[논문 리뷰] Similarity-preserving Image-image Domain Adaptation for Person Re-identification
이 논문은 생성적 적대 기반 네트워크(GAN)를 사용한 유사도 유지 이미지-이미지 도메인 적응 프레임워크(SP-GAN)와 그 엔드 투 엔드 변형(eSP-GAN)을 제안하여 인물 재식별(person re-identification)을 위한 유사도 유지 도메인 적응을 수행한다. 스타일 전이 과정에서 신원 유사성 유지 및 이미지 번역과 특징 학습을 동시에 최적화함으로써, Market-1501과 DukeMTMC-reID에서 최신 기술 수준(SOTA) 성능을 달성하였으며, eSP-GAN은 LMP를 사용하여 Market-1501에서 단일 쿼리 설정 하에서 63.6%의 랭크-1 정확도를 기록하였다.
This article studies the domain adaptation problem in person re-identification (re-ID) under a "learning via translation" framework, consisting of two components, 1) translating the labeled images from the source to the target domain in an unsupervised manner, 2) learning a re-ID model using the translated images. The objective is to preserve the underlying human identity information after image translation, so that translated images with labels are effective for feature learning on the target domain. To this end, we propose a similarity preserving generative adversarial network (SPGAN) and its end-to-end trainable version, eSPGAN. Both aiming at similarity preserving, SPGAN enforces this property by heuristic constraints, while eSPGAN does so by optimally facilitating the re-ID model learning. More specifically, SPGAN separately undertakes the two components in the "learning via translation" framework. It first preserves two types of unsupervised similarity, namely, self-similarity of an image before and after translation, and domain-dissimilarity of a translated source image and a target image. It then learns a re-ID model using existing networks. In comparison, eSPGAN seamlessly integrates image translation and re-ID model learning. During the end-to-end training of eSPGAN, re-ID learning guides image translation to preserve the underlying identity information of an image. Meanwhile, image translation improves re-ID learning by providing identity-preserving training samples of the target domain style. In the experiment, we show that identities of the fake images generated by SPGAN and eSPGAN are well preserved. Based on this, we report the new state-of-the-art domain adaptation results on two large-scale person re-ID datasets.
연구 동기 및 목표
- 데이터셋 편향과 도메인 이동으로 인해 인물 재식별 모델의 일반화 성능이 떨어지는 문제를 해결한다.
- 공통 클래스 집합을 가정하는 기존 비지도 도메인 적응 방법의 한계를 극복한다. 이는 인물 재식별에서는 성립하지 않는 가정이다.
- 원본 도메인에서 타겟 도메인으로의 이미지 번역 과정에서도 구분 가능한 신원 특징을 유지함으로써, 스타일 변화에도 불구하고 신원 일관성을 확보한다.
- 이미지 번역과 특징 학습을 엔드 투 엔드 프레임워크로 통합하여 상호 최적화를 가능하게 하고, 더 나은 적응 성능을 달성한다.
- 타겟 도메인의 레이블 없이도 대규모 인물 재식별 벤치마크에서 최신 기술 수준의 도메인 적응 성능을 달성한다.
제안 방법
- 이미지 번역을 위한 CycleGAN과 신원 유사성 및 도메인 비유사성을 강제하는 대비 손실을 통해 신원 유사성과 도메인 비유사성을 유지하는 두 구성 요소로 이루어진 SP-GAN 프레임워크를 제안한다.
- SP-GAN에서 사이라미스 네트워크는 번역된 원본 이미지와 그 원본 이미지를 가까이 끌어당기며, 동시에 타겟 도메인의 이미지로부터 이를 밀어내어, 비지도 방식으로 신원 신호를 유지한다.
- 이미지 번역과 재식별 특징 학습을 교차적으로 훈련함으로써 동시에 최적화하는 엔드 투 엔드 확장형 eSP-GAN을 도입하여, 구성 요소 간의 상호 지시 기능을 가능하게 한다.
- SP-GAN에서 대비 손실을 사용하여 신원의 자기 유사성을 유지하고 도메인 간 비유사성을 도입함으로써, 번역된 이미지가 신원 정보를 유지하면서도 타겟 도메인의 시각적 스타일을 충족하도록 한다.
- LMP(Local Maximal Occurrence Pooling)를 후처리 보강 기법으로 통합하여, 특히 다중 쿼리 설정에서 성능 향상을 더욱 높였다.
- 이미지 번역을 위한 적대적 손실과 신원 유지에 대한 대비 손실을 사용하여 훈련하며, eSP-GAN에서는 엔드 투 엔드 역전파를 통해 최적화한다.
실험 결과
연구 질문
- RQ1원본 도메인에서 타겟 도메인으로의 이미지 번역 과정에서 보행자의 기본적인 신원 정보가 유지되는가?
- RQ2비지도 이미지 번역을 어떻게 제약하여 새로운 도메인의 시각적 스타일에 적응하면서도 구분 가능한 신원 특징을 유지할 수 있는가?
- RQ3이미지 번역과 특징 학습을 엔드 투 엔드 방식으로 동시에 최적화하면 인물 재식별에서 도메인 적응 성능이 향상되는가?
- RQ4유사도 유지 GAN 프레임워크가 대규모 인물 재식별 데이터셋에서 기존 최신 기술 수준의 비지도 도메인 적응 방법을 능가할 수 있는가?
- RQ5신원 유지 제약 조건을 이미지 번역 파이프라인에 통합할 경우, 후속 재식별 정확도에 어떤 영향을 미치는가?
주요 결과
- eSP-GAN은 단일 쿼리 설정 하에서 Market-1501에서 63.6%의 랭크-1 정확도를 기록하여, 두 번째로 좋은 성능을 낸 HHL보다 1.4% 높게 기록하며 새로운 최신 기술 수준을 달성하였다.
- DukeMTMC-reID에서 eSP-GAN은 LMP(P=8)를 사용하여 52.6%의 랭크-1 정확도를 기록하며 새로운 최신 기술 수준을 설정하였으며, HHL보다 1.0% 높은 성능을 보였다.
- SP-GAN은 단일 쿼리 설정 하에서 Market-1501에서 59.5%의 랭크-1 정확도를 기록하여, TJ-AIDL를 1.3% 뛰어넘었으며 강력한 경쟁력을 입증하였다.
- LMP(P=8)의 통합은 eSP-GAN의 성능을 Market-1501에서 63.6%까지 끌어올려, 후처리가 도메인 적응 성과를 더욱 향상시킬 수 있음을 시사한다.
- eSP-GAN의 엔드 투 엔드 훈련은 SP-GAN보다 더 높은 성능을 달성하여, 이미지 번역과 특징 학습 간의 공동 최적화가 유의미한 이점을 제공한다는 점을 확인하였다.
- SP-GAN과 eSP-GAN은 수작업 특징(Bag of Words, LOMO) 및 비지도 방법(PUL, UMDL)보다 뚜렷하게 뛰어난 성능을 보이며, 도메인 적응에서의 효과성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.