Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Virtual and Real Person for Unsupervised Person Re-identification

Fengxiang Yang, Zhun Zhong|arXiv (Cornell University)|2018. 11. 05.
Video Surveillance and Tracking Methods참고 문헌 12인용 수 4
한 줄 요약

이 논문은 레이블이 없는 상태에서 실존하는 사람 이미지와 가상(가공된) 사람 이미지를 활용하여 딥 재식별 모델을 훈련하는 새로운 비지도(person re-identification) 프레임워크를 제안한다. GAN 기반의 자세 및 스타일 전이를 통해 가상의 사람에 대한 가짜 레이블을 생성한 후, 공동 필터링을 통해 실존 데이터에서 신뢰할 수 있는 양성 쌍을 반복적으로 추출하여, Market-1501과 DukeMTMC-reID에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Person re-identification (re-ID) is a challenging problem especially when no labels are available for training. Although recent deep re-ID methods have achieved great improvement, it is still difficult to optimize deep re-ID model without annotations in training data. To address this problem, this study introduces a novel approach for unsupervised person re-ID by leveraging virtual and real data. Our approach includes two components: virtual person generation and training of deep re-ID model. For virtual person generation, we learn a person generation model and a camera style transfer model using unlabeled real data to generate virtual persons with different poses and camera styles. The virtual data is formed as labeled training data, enabling subsequently training deep re-ID model in supervision. For training of deep re-ID model, we divide it into three steps: 1) pre-training a coarse re-ID model by using virtual data; 2) collaborative filtering based positive pair mining from the real data; and 3) fine-tuning of the coarse re-ID model by leveraging the mined positive pairs and virtual data. The final re-ID model is achieved by iterating between step 2 and step 3 until convergence. Experimental results on two large-scale datasets, Market-1501 and DukeMTMC-reID, demonstrate the effectiveness of our approach and shows that the state of the art is achieved in unsupervised person re-ID.

연구 동기 및 목표

  • 레이블이 없는 훈련 데이터로 딥 사람 재식별 모델을 훈련시키는 데 도전하는 것.
  • 수작업 특징이 실패하는 대규모 데이터셋에서 비지도 재식별 성능을 향상시키는 것.
  • 실제로 레이블이 없는 실존 데이터와 가상의 가공 데이터만을 사용하여 지도 학습 스타일의 딥 재식별 모델을 훈련시키는 것.
  • 실존하는 레이블이 없는 데이터에서 신뢰할 수 있는 양성 이미지 쌍을 추출하는 강력한 방법을 개발하는 것.
  • 베이직 테스트 데이터셋에서 비지도 사람 재식별 분야에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • DPG-GAN을 사용해 자세 변형을, Star-GAN을 사용해 카메라 스타일 전이를 통해 가상의 사람 이미지를 생성하여 가짜 레이블이 부여된 훈련 데이터를 만든다.
  • 정체성 분류 손실(L_cls)을 사용하여 생성된 가상 데이터에서 거친 재식별 모델을 사전 훈련한다.
  • 사전 훈련된 모델을 사용해 특징을 추출하고, 실존 데이터에서 k-상호근접 이웃(k-RNNs)을 계산하여 초기 양성 쌍 후보를 확보한다.
  • 공동 필터링 기반 접근 방식을 적용하여 잘못된 양성 쌍을 걸러내고 실존 데이터에서 고신뢰도의 양성 쌍을 선별한다.
  • 가상 데이터에서의 L_cls와 추출된 실존 양성 쌍에서의 트리플릿 손실을 조합한 다중 과제 손실을 사용해 재식별 모델을 미세 조정한다.
  • 수렴할 때까지 양성 쌍 추출과 모델 미세 조정을 반복하여 모델의 강건성과 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1가짜 레이블이 부여된 가상의 사람 이미지가 실제 레이블이 없을 경우에 딥 재식별 모델을 효과적으로 사전 훈련하는 데 유용한가?
  • RQ2공동 필터링 기반의 방법이 비지도 재식별에서 레이블이 없는 실존 데이터로부터의 양성 쌍 추출 품질을 향상시킬 수 있는가?
  • RQ3가상 데이터와 정제된 실존 데이터 쌍을 조합하면 대규모 재식별 벤치마크에서 더 나은 일반화 및 성능을 달성할 수 있는가?
  • RQ4가상 데이터 크기, 배치 크기, 손실 가중치와 같은 하이퍼파라미터에 대해 이 방법의 민감도는 어떠한가?
  • RQ5제안된 프레임워크는 어떤 레이블 데이터 없이도 비지도 사람 재식별에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 비지도 설정에서 Market-1501과 DukeMTMC-reID에서 최신 기술 수준의 성능을 달성하여 기존 방법들을 능가한다.
  • 공동 필터링 기반의 추출은 Market-1501과 DukeMTMC-reID에서 각각 랭크-1 정확도를 무작위 선택 대비 6.6%와 2.9% 향상시켰다.
  • 추출된 양성 쌍의 정확도는 무작위 선택 시 29.0%와 14.5%에서 공동 필터링을 사용할 경우 67.5%와 40.5%로 상승하여 더 높은 쌍 품질을 확인했다.
  • 가상 데이터셋 크기가 Market-1501과 DukeMTMC-reID에서 각각 36명과 48명의 정체성에 도달할 때 성능이 포화 상태에 이르렀다.
  • 다중 과제 학습에서 최적의 손실 가중치(λ)는 약 1이며, 이 경우 분류 손실과 트리플릿 손실이 성능 향상에 동일한 기여를 한다.
  • k와 배치 크기(N_r)의 변화에 대해 성능 변동이 최소한이었으며, 테스트된 설정 전반에서 안정적인 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.