Skip to main content
QUICK REVIEW

[논문 리뷰] DomainMix: Learning Generalizable Person Re-Identification Without Human Annotations

Wenhao Wang, Shengcai Liao|arXiv (Cornell University)|2020. 11. 24.
Video Surveillance and Tracking Methods참고 문헌 33인용 수 22
한 줄 요약

이 논문은 레이블이 부여된 합성 데이터와 레이블이 없는 실세계 이미지만을 사용하여 일반화 가능한 모델을 훈련시키는 새로운 프레임워크인 DomainMix를 제안한다. 이는 인간의 주석이 필요 없도록 한다. 도메인 균형 손실과 실 이미지의 적응형 클러스터링을 도입함으로써 도메인 갭을 줄이고, 인간이 주석을付けた 실세계 데이터가 전혀 없는 상태에서 여러 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Existing person re-identification models often have low generalizability, which is mostly due to limited availability of large-scale labeled data in training. However, labeling large-scale training data is very expensive and time-consuming, while large-scale synthetic dataset shows promising value in learning generalizable person re-identification models. Therefore, in this paper a novel and practical person re-identification task is proposed,i.e. how to use labeled synthetic dataset and unlabeled real-world dataset to train a universal model. In this way, human annotations are no longer required, and it is scalable to large and diverse real-world datasets. To address the task, we introduce a framework with high generalizability, namely DomainMix. Specifically, the proposed method firstly clusters the unlabeled real-world images and selects the reliable clusters. During training, to address the large domain gap between two domains, a domain-invariant feature learning method is proposed, which introduces a new loss,i.e. domain balance loss, to conduct an adversarial learning between domain-invariant feature learning and domain discrimination, and meanwhile learns a discriminative feature for person re-identification. This way, the domain gap between synthetic and real-world data is much reduced, and the learned feature is generalizable thanks to the large-scale and diverse training data. Experimental results show that the proposed annotation-free method is more or less comparable to the counterpart trained with full human annotations, which is quite promising. In addition, it achieves the current state of the art on several person re-identification datasets under direct cross-dataset evaluation.

연구 동기 및 목표

  • 작은 인간 주석 데이터셋으로 훈련된 인물 재식별 모델의 일반화 능력이 제한되는 문제를 해결하기 위해.
  • 실세계 훈련 데이터에 대한 고비용 인간 주석에 의존하지 않도록 하기 위해.
  • 대규모 레이블이 부여된 합성 데이터와 다양한 레이블이 없는 실세계 데이터를 효과적으로 조합하여 모델의 일반화 능력을 향상시키기 위해.
  • 레이블이 없는 실세계 데이터가 필요 없이 합성 데이터와 실세계 데이터 사이의 도메인 갭을 줄이기 위해.
  • 미래의 타겟 도메인에 잘 일반화되는 확장 가능한 주석 없는 훈련 파라다임을 개발하기 위해.

제안 방법

  • 각 훈련 에포크에서 DBSCAN을 사용하여 레이블이 없는 실세계 이미지를 클러스터링하여 잠재적인 신원을 탐지한다.
  • 밀도, 독립성, 수량의 세 가지 기준을 적용하여 노이즈가 있는 클러스터링 결과에서 신뢰할 수 있는 클러스터를 필터링하고 선택한다.
  • 도메인 불변 특징 학습과 도메인 식별 간의 적대적 학습을 수행하는 도메인 균형 손실을 도입한다.
  • 합성 데이터와 실세계 데이터 사이의 도메인 이동을 최소화하면서 인물 재식별을 위한 분류 특징을 학습하는 공동 모델을 훈련시킨다.
  • 각 에포크의 선택된 클러스터에 포함된 신원 수에 따라 동적으로 조정되는 적응형 분류 레이어 초기화를 사용한다.
  • IBN-Net 및 OSNet-IBN 등의 다양한 백본 아키텍처와 함께 프레임워크를 활용하여 광범위한 호환성을 입증한다.

실험 결과

연구 질문

  • RQ1인간 주석이 없는 실세계 훈련 데이터 없이도 인물 재식별 모델이 높은 일반화 성능을 달성할 수 있는가?
  • RQ2합성 데이터와 실세계 데이터 사이의 도메인 갭을 효과적으로 줄여 모델의 일반화 능력을 향상시킬 수 있는가?
  • RQ3사전 주석 없이도 클러스터링을 통해 레이블이 없는 실세계 데이터에서 신뢰할 수 있는 신원을 탐지할 수 있는가?
  • RQ4표준 도메인 적응 기법과 비교해 적대적 도메인 균형 학습이 도메인 간 특징 일반화를 향상시키는가?
  • RQ5제안된 프레임워크가 인간 주석 없이 직접 교차 데이터셋 평가에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • DomainMix는 레이블이 부여된 합성 데이터와 레이블이 없는 실세계 이미지만을 사용하여 Market1501에서 43.5% mAP, 70.2% 랭크-1 정확도를 달성하며, 전체 인간 주석 데이터로 훈련된 모델들을 능가한다.
  • CUHK03-NP에서 DomainMix는 16.7% mAP와 18.0% 랭크-1를 기록하여, 실세계 주석이 전혀 없는 RandPerson으로 훈련된 모든 베이스라인을 능가한다.
  • OSNet-IBN 백본을 사용할 경우, DomainMix는 Market1501에서 44.6% mAP와 72.9% 랭크-1를 달성하여 제안된 주석 없는 설정에서 새로운 최고 기록을 수립한다.
  • RandPerson 합성 데이터와 레이블이 없는 MSMT17 데이터를 조합할 경우, 베이스라인 모델 대비 최대 7.0% mAP 향상을 기록한다.
  • 도메인 균형 손실은 합성 데이터와 실세계 데이터 사이의 도메인 갭을 크게 줄여, 미리 보지 않은 도메인으로의 일반화 능력을 향상시킨다.
  • 프레임워크는 다양한 데이터셋 간에 잘 일반화되며, RandPerson과 레이블이 없는 Market1501에서 훈련했을 때 MSMT17에서 13.6% mAP, 36.2% 랭크-1의 최신 기술 수준 결과를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.