[논문 리뷰] Identity Preserving Generative Adversarial Network for Cross-Domain Person Re-identification
이 논문은 정체성 의미를 유지하는 생성적 적대적 네트워크(IPGAN)를 제안한다. 이는 라벨이 부여된 소스 도메인의 인물 이미지를 정체성 의미를 유지하면서 타겟 카메라 도메인으로 변환하는 새로운 비지도 도메인 적응 방법이다. 정체성에 정확한 스타일 이식 이미지를 생성함으로써, IPGAN은 더 일반화된 re-ID 모델(IBN-reID)을 훈련시켜 Market-1501과 DukeMTMC-reID에서 각각 순위-1 정확도 57.2%와 47.0%의 최신 기술 수준(SOTA) 성능을 달성한다.
Person re-identification is to retrieval pedestrian images from no-overlap camera views detected by pedestrian detectors. Most existing person re-identification (re-ID) models often fail to generalize well from the source domain where the models are trained to a new target domain without labels, because of the bias between the source and target domain. This issue significantly limits the scalability and usability of the models in the real world. Providing a labeled source training set and an unlabeled target training set, the aim of this paper is to improve the generalization ability of re-ID models to the target domain. To this end, we propose an image generative network named identity preserving generative adversarial network (IPGAN). The proposed method has two excellent properties: 1) only a single model is employed to translate the labeled images from the source domain to the target camera domains in an unsupervised manner; 2) The identity information of images from the source domain is preserved before and after translation. Furthermore, we propose IBN-reID model for the person re-identification task. It has better generalization ability than baseline models, especially in the cases without any domain adaptation. The IBN-reID model is trained on the translated images by supervised methods. Experimental results on Market-1501 and DukeMTMC-reID show that the images generated by IPGAN are more suitable for cross-domain person re-identification. Very competitive re-ID accuracy is achieved by our method.
연구 동기 및 목표
- 소스 도메인에서 훈련된 모델이 스타일과 분포의 차이로 인해 새로운 타겟 도메인에서 실패하는 도메인 이동 문제를 해결한다.
- 기존 GAN 기반 방법들이 타겟 도메인 내 개별 카메라 간의 하위 도메인 수준의 편향을 忽시하는 한계를 극복한다.
- 소스 도메인에서 타겟 카메라 도메인으로의 이미지 번역 과정에서 정체성 의미를 유지하여 합성 훈련 데이터의 레이블 일관성을 유지한다.
- 비지도 이미지 번역과 새로운 정규화 기반 re-ID 아키텍처를 활용하여 타겟 도메인 레이블 데이터가 필요 없이 모델 일반화 능력을 향상시킨다.
- 단일 생성기와 정체성 불변 번역을 사용하여 크로스 도메인 환경에서 경쟁적인 re-ID 정확도를 달성한다.
제안 방법
- 단일 생성기와 도메인 구분기로 소스 도메인의 이미지를 다수의 타겟 카메라 도메인으로 매핑하는 GAN 기반 이미지 번역 프레임워크인 IPGAN을 제안한다.
- 실제 이미지와 변환된 이미지의 정체성 임베딩이 일관성을 유지하도록 보장함으로써 정체성 불변성을 강제하는 새로운 의미 구분기를 도입한다.
- 생성기를 적대적 손실과 정체성 복원 손실을 모두 최소화하도록 훈련시켜 변환된 이미지가 원본과 동일한 정체성을 유지하도록 보장한다.
- 원본 레이블을 유지하면서 타겟 카메라 스타일을 채택한 생성된 이미지를 합성 훈련 세트로 사용하여 지도형 re-ID 모델 훈련을 수행한다.
- 외곽선 블록에 인스턴스 정규화와 배치 정규화를 통합하여 외관 불변성과 특징 분류 능력을 향상시키는 IBN-reID 모델을 설계한다.
- 지도 학습을 사용하여 번역된 데이터에서 IBN-reID 모델을 훈련시켜 미리 보지 않은 타겟 도메인으로의 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1단일 생성 모델이 정체성 정보를 유지하면서 소스 도메인의 이미지를 여러 개의 서로 다른 타겟 카메라 도메인으로 효과적으로 번역할 수 있는가?
- RQ2이미지 번역 과정에서 정체성 불변성을 강제하면, 새로운 도메인에서 인물 재식별 모델의 성능이 뚜렷이 향상되는가?
- RQ3인스턴스 정규화와 배치 정규화를 조합한 IBN-reID 모델 아키텍처가 크로스 도메인 re-ID에서 일반화 능력을 얼마나 향상시키는가?
- RQ4제안된 IPGAN 기반 도메인 적응 방법은 최신 기술 수준의 비지도 re-ID 접근법과 정확도와 강건성 측면에서 어떻게 비교되는가?
- RQ5정체성 유지 이미지 번역은 표준 GAN 또는 사이클 일관성 GAN보다 소스와 타겟 카메라 도메인 간의 도메인 이동을 더 효과적으로 줄일 수 있는가?
주요 결과
- IPGAN가 생성한 이미지는 DukeMTMC-reID와 Market-1501 훈련 세트에서 각각 97.0%와 99.0%의 분류 정확도를 기록하여 강력한 정체성 유지 능력을 입증한다.
- IPGAN를 통해 직접 소스 도메인에서 타겟 도메인으로 이식된 IBN-reID 모델은 DukeMTMC-reID에서 순위-1 정확도 32.4%와 mAP 17.3%를 기록하며, 베이스라인 대비 +2.2%와 +1.2% 향상되었다.
- IPGAN를 활용한 데이터 합성으로 IBN-reID 모델은 Market-1501에서 57.2% 순위-1 정확도와 28.0% mAP를 달성하여 기존 최고의 방법을 초월했다.
- DukeMTMC-reID에서 이 방법은 47.0% 순위-1 정확도와 27.0% mAP를 기록하며, CamStyle 대비 +1.9 mAP 포인트 향상되었다.
- IPGAN와 IBN-reID의 조합은 최고의 종합 성능을 보였으며, IPGAN 생성 데이터에서 IBN-reID를 사용할 경우 근소한 성능 향상만 나타나, IPGAN가 이미 도메인 이동 문제를 효과적으로 완화하고 있음을 시사한다.
- StarGAN과 비교해 볼 때, IPGAN는 생성된 이미지에서 정체성 분류 정확도가 뚜렷이 높아 정체성 의미를 더 효과적으로 유지함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.