Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Generative and Contrastive Learning for Unsupervised Person Re-identification

Chen, Hao, Wang, Yaohui|arXiv (Cornell University)|2020. 12. 16.
Video Surveillance and Tracking Methods참고 문헌 51인용 수 10
한 줄 요약

이 논문은 레이블이 부여된 소스 데이터셋이 필요 없이 3D 메시 기반 GAN을 사용해 다양한 새로운 시각을 생성하는 동시 생성 및 대비 학습 프레임워크를 제안한다. 정체성과 구조 특징을 분리함으로써 생성 및 대비 학습 간 상호 최적화를 통해 시각 불변 표현 학습을 향상시키며, 완전히 비지도 학습 및 도메인 적응 설정 모두에서 여러 ReID 벤치마크에서 최신 기준 성능을 달성한다.

ABSTRACT

Recent self-supervised contrastive learning provides an effective approach for unsupervised person re-identification (ReID) by learning invariance from different views (transformed versions) of an input. In this paper, we incorporate a Generative Adversarial Network (GAN) and a contrastive learning module into one joint training framework. While the GAN provides online data augmentation for contrastive learning, the contrastive module learns view-invariant features for generation. In this context, we propose a mesh-based view generator. Specifically, mesh projections serve as references towards generating novel views of a person. In addition, we propose a view-invariant loss to facilitate contrastive learning between original and generated views. Deviating from previous GAN-based unsupervised ReID methods involving domain adaptation, we do not rely on a labeled source dataset, which makes our method more flexible. Extensive experimental results show that our method significantly outperforms state-of-the-art methods under both, fully unsupervised and unsupervised domain adaptive settings on several large scale ReID datsets.

연구 동기 및 목표

  • 간단한 데이터 증강 기법에 의존하는 전통적인 자기지도 대비 학습의 제한성, 즉 시각 다양성이 제한적인 문제를 해결하기 위해.
  • 도메인 적응 접근 방식에서 흔히 볼 수 있는 GAN 기반 비지도 ReID에서 레이블이 부여된 소스 데이터셋에 대한 의존도를 제거하기 위해.
  • 3D 메시 분리 기반으로 현실적이고 다양한 새로운 시각을 생성함으로써 비지도 인물 재식별에서 특징의 강건성을 향상시키기 위해.
  • 공유된 정체성 특징 인코더를 통해 생성 모듈과 대비 모듈 간 상호 개선을 가능하게 하기 위해.

제안 방법

  • 비라벨 이미지에서 신체 형태와 자세를 추정할 수 있는 3D 메시 기반 시각 생성기를 도입하여 메시 회전을 통한 구조적 시각 합성 가능하게 한다.
  • 제어 가능한 이미지 생성을 위해 정체성 특징(색상, 신체 형태)과 구조 특징(자세, 시점)을 분리한다.
  • 동일한 사람의 원본 시각과 생성된 시각 간 표현 유사도를 최대화하고, 서로 다른 정체성 간 유사도를 최소화하기 위해 시각 불변 대비 손실을 설계한다.
  • 공유된 정체성 특징 인코더를 통해 생성 및 대비 모듈을 함께 훈련함으로써 상호 최적화를 가능하게 한다.
  • 완전히 비지도 학습 및 비지도 도메인 적응 설정 모두에서 작동하며, 두 설정 모두에서 성능 향상을 기록한다.
  • 생성 품질 평가에 Fréchet Inception Distance (FID)와 Structural Similarity (SSIM)를 사용하며, SSIM은 구조적 다양성에 중점을 둔다.

실험 결과

연구 질문

  • RQ1레이블이 부여된 소스 데이터셋에 의존하지 않고 3D 메시 기반 GAN이 비지도 인물 재식별을 위해 다양하고 정체성 유지가 가능한 새로운 시각을 생성할 수 있는가?
  • RQ2생성 및 대비 모듈의 동시 훈련이 별도 훈련에 비해 특징 표현 품질을 향상시키는가?
  • RQ3완전히 비지도 설정에서 정체성과 구조 특징을 효과적으로 분리하여 제어 가능한 이미지 생성이 가능한가?
  • RQ4제안된 시각 불변 손실이 대비 학습에서 시각 불변 표현 학습을 어떻게 향상시키는가?
  • RQ5스켈레톤 가이드 또는 표준 데이터 증강에 비해 메시 기반 생성 방식은 생성 품질과 ReID 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 완전히 비지도 학습 및 비지도 도메인 적응 설정 모두에서 Market-1501, DukeMTMC-ReID, MSMT17에서 최신 기준 성능을 달성한다.
  • 완전히 비지도 설정에서 Market-1501에서 순위 1 정확도 78.6% 및 mAP 62.3%를 기록하며, 이는 이전 최고 성능 방법을 초월한다.
  • Market-1501에서 Fréchet Inception Distance (FID)는 59.86, SSIM은 0.367을 기록하여 생성된 이미지의 높은 현실성과 구조적 다양성을 입증한다.
  • 제거 실험 결과, 시각 불변 손실이 표현 학습을 크게 향상시키며, 기준 대비 대비 학습 대비 4.2% mAP 향상을 기록한다.
  • 정성적 결과에서 정체성과 구조 특징이 효과적으로 분리되어 있음을 확인하였으며, 구조만 변경해도 외형이 유지되고, 반대로 정체성만 변경해도 자세 및 시점이 유지됨을 확인할 수 있다.
  • 낮은 FID에도 불구하고 SSIM에서 DG-Net(0.367 대비 0.360)을 능가함으로써 더 나은 구조적 다양성과 더 적은 아티팩트를 갖춘 생성된 시각을 제공함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.