[논문 리뷰] Apparel-invariant Feature Learning for Apparel-changed Person Re-identification
이 논문은 실시간 카메라 영상에서의 옷 변화 상황에서도 성능이 떨어지는 문제를 해결하기 위해, 옷에 관계없이 일관된 특징을 학습하는 반감독형 옷-불변 특징 학습(AIFL) 프레임워크를 제안한다. 이는 새로운 비지도 옷 시뮬레이션 GAN(AS-GAN)을 활용하여 실제와 유사한 옷이 바뀐 이미지를 합성함으로써, 실제 이미지와 합성 이미지 쌍을 모두 활용해 훈련함으로써 특징의 강건성을 향상시킨다. 이로 인해 MSMT17 및 C-MARS 데이터셋에서 인간의 수작업 레이블이 거의 필요 없이 mAP와 CMC 성능이 크게 향상되었다.
With the rise of deep learning methods, person Re-Identification (ReID) performance has been improved tremendously in many public datasets. However, most public ReID datasets are collected in a short time window in which persons' appearance rarely changes. In real-world applications such as in a shopping mall, the same person's clothing may change, and different persons may wearing similar clothes. All these cases can result in an inconsistent ReID performance, revealing a critical problem that current ReID models heavily rely on person's apparels. Therefore, it is critical to learn an apparel-invariant person representation under cases like cloth changing or several persons wearing similar clothes. In this work, we tackle this problem from the viewpoint of invariant feature representation learning. The main contributions of this work are as follows. (1) We propose the semi-supervised Apparel-invariant Feature Learning (AIFL) framework to learn an apparel-invariant pedestrian representation using images of the same person wearing different clothes. (2) To obtain images of the same person wearing different clothes, we propose an unsupervised apparel-simulation GAN (AS-GAN) to synthesize cloth changing images according to the target cloth embedding. It's worth noting that the images used in ReID tasks were cropped from real-world low-quality CCTV videos, making it more challenging to synthesize cloth changing images. We conduct extensive experiments on several datasets comparing with several baselines. Experimental results demonstrate that our proposal can improve the ReID performance of the baseline models.
연구 동기 및 목표
- 옷의 특징에 크게 의존하는 기존 인물 재식별 모델이 옷이 바뀌거나 유사한 옷을 입었을 경우 성능 저하가 발생하는 심각한 한계를 해결하기 위해.
- 쇼핑몰과 같은 장기적인 재식별 환경에서 옷의 변화에 대해 강건한 특징을 학습할 수 있는 옷-불변 표현을 개발하기 위해.
- 최소한의 레이블 데이터를 활용하는 반감독형 프레임워크를 통해 고비용의 수작업 레이블링에 대한 의존도를 줄이기 위해.
- 저품질의 CCTV 촬영 영상에서도 GAN을 활용해 실제감 있는 옷 변화를 시뮬레이션하는 이미지 합성 파이프라인을 구축하기 위해.
- 옷의 다양성이 흔한 실세계 환경에서 재식별 모델의 일반화 능력과 강건성을 향상시키기 위해.
제안 방법
- 목표 옷 임베딩를 활용해 동일한 사람의 다른 옷을 입은 실제와 유사한 이미지를 생성하는 비지도 옷 시뮬레이션 GAN(AS-GAN)을 제안한다.
- 표준 Conv2d 블록을 대체하기 위해 AS-GAN의 생성기에서 개선된 잔차 블록을 도입하여 이미지의 현실성과 특징 품질을 향상시킨다.
- 실제 이미지와 AS-GAN에서 생성된 합성 이미지 쌍을 활용해 초기화된 반감독형 AIFL 프레임워크를 설계한다.
- AIFL에 도메인 구분기 $D_T$를 통합하여 실제 도메인과 합성 도메인 간의 특징을 정렬함으로써 특징 일반화 능력을 향상시킨다.
- 이중 단계 훈련 프로세스를 적용한다: 먼저 AS-GAN을 이미지 쌍으로 미리 훈련한 후, 이 쌍을 활용해 ReID 모델을 초기화하고 나서 실제 데이터로 미세조정한다.
- 합성 이미지 쌍의 수를 늘려 데이터 볼륨 스케일링을 구현함으로써 모델 성능을 점진적으로 향상시킨다.
실험 결과
연구 질문
- RQ1저품질의 CCTV 촬영 영상에서부터 시작해, GAN 기반의 이미지 합성 기법이 재식별 데이터 증강을 위해 실제감 있는 옷이 바뀐 이미지를 효과적으로 생성할 수 있는가?
- RQ2합성 이미지 쌍과 실제 이미지 쌍을 활용한 반감독 훈련이 인물 재식별에서 옷-불변 특징 학습에 기여하는가?
- RQ3도메인 구분기 $D_T$의 포함 여부가 학습된 ReID 특징의 강건성과 일반화 능력에 어떤 영향을 미치는가?
- RQ4합성 이미지 쌍의 수를 늘릴수록 분포 이탈이 발생하지 않으면서 재식별 성능 향상에 얼마나 기여하는가?
- RQ5제안된 방법은 레이블링된 데이터 의존도를 줄일 수 있으며, mAP와 CMC 점수를 유지하거나 향상시킬 수 있는가?
주요 결과
- 개선된 AS-GAN 생성기를 사용한 AIFL 프레임워크는 MSMT17 데이터셋에서 mAP 35.24%와 CMC@1 65.96%를 달성하여 기준 모델을 능가했다.
- AS-GAN에 개선된 잔차 블록을 적용함으로써 이미지의 현실성이 크게 향상되었고, 이는 표준 Conv2d 블록 대비 AIFL 프레임워크의 성능 향상으로 이어졌다.
- AIFL에서 도메인 구분기 $D_T$를 제거하면 성능이著명하게 저하되었으며, mAP가 35.24%에서 31.61%로 감소하여 도메인 정렬에 있어 그 중요성을 입증했다.
- 합성 이미지 쌍의 수를 1세트에서 5세트로 늘임으로써 MSMT17에서 mAP가 30.80%에서 35.24%로 상승하여 이 방법의 확장 가능성을 확인했다.
- 합성 데이터 생성 후에는 제한된 레이블링만 필요로 하므로, 레이블링에 대한 의존도를 효과적으로 줄였으며, 실세계 적용에 실용적임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.