Skip to main content
QUICK REVIEW

[논문 리뷰] Identity-Seeking Self-Supervised Representation Learning for Generalizable Person Re-identification

Zhaopeng Dou, Zhongdao Wang|arXiv (Cornell University)|2023. 08. 17.
Video Surveillance and Tracking MethodsComputer Science인용 수 3
한 줄 요약

이 논문은 인간의 레이블 없이 4780만 개의 레이블이 없는 비디오 프레임에서 도메인 일반화 가능한 인물 재식별 표현을 학습하는 자기지도 학습 표현 학습 방법인 정체성 탐색 자기지도 학습 표현 학습(ISR)을 제안한다. 서로 다른 프레임 간의 정체성 연관을 최대 무게 이분 매칭 문제로 공식화하고, 신뢰도 유도 대비 손실을 사용함으로써, ISR는 최신 기술 수준의 성능을 달성하여, 제로샷 도메인 일반화 설정에서 Market-1501에서 87.0% Rank-1, MSMT17에서 56.4%를 기록하며, 각각 감독 학습 방법보다 5.0%와 19.5% 높은 성능을 보였다.

ABSTRACT

This paper aims to learn a domain-generalizable (DG) person re-identification (ReID) representation from large-scale videos extbf{without any annotation}. Prior DG ReID methods employ limited labeled data for training due to the high cost of annotation, which restricts further advances. To overcome the barriers of data and annotation, we propose to utilize large-scale unsupervised data for training. The key issue lies in how to mine identity information. To this end, we propose an Identity-seeking Self-supervised Representation learning (ISR) method. ISR constructs positive pairs from inter-frame images by modeling the instance association as a maximum-weight bipartite matching problem. A reliability-guided contrastive loss is further presented to suppress the adverse impact of noisy positive pairs, ensuring that reliable positive pairs dominate the learning process. The training cost of ISR scales approximately linearly with the data size, making it feasible to utilize large-scale data for training. The learned representation exhibits superior generalization ability. extbf{Without human annotation and fine-tuning, ISR achieves 87.0\% Rank-1 on Market-1501 and 56.4\% Rank-1 on MSMT17}, outperforming the best supervised domain-generalizable method by 5.0\% and 19.5\%, respectively. In the pre-training$ ightarrow$fine-tuning scenario, ISR achieves state-of-the-art performance, with 88.4\% Rank-1 on MSMT17. The code is at \url{https://github.com/dcp15/ISR_ICCV2023_Oral}.

연구 동기 및 목표

  • 인간 레이블 데이터에 의존하지 않고 도메인 일반화 가능한 인물 재식별 표현을 학습하는 것.
  • 높은 애너테이션 비용으로 인해 소규모 레이블 데이터셋에 의존하는 기존 도메인 일반화 가능한 ReID 방법의 한계를 극복하는 것.
  • 인터넷 비디오에 존재하는 다양한 도메인의 특성을 활용하기 위해 대규모 비지도 비디오 데이터를 활용하여 학습하는 것.
  • 사전 훈련 후 미세조정 없이도 새로운 도메인에 제로샷으로 배포 가능한 ReID 모델을 가능하게 하는 것.
  • 정체성 식별을 학습하는 자기지도 학습 방법을 개발하여 확장 가능한 방법을 제공하는 것.

제안 방법

  • 비디오 프레임 간의 인스턴스 연관을 최대 무게 이분 매칭 문제로 공식화하여, 프레임 간에 정체성이 같은 쌍을 탐색한다.
  • 최적의 매칭을 기반으로 양성 쌍을 구성함으로써, 동일한 정체성의 이미지가 함께 묶이도록 보장한다.
  • 노이즈가 있는 양성 쌍을 가중치를 낮추고 신뢰도가 높은 쌍을 우선시하는 신뢰도 유도 대비 손실을 도입한다.
  • 메모리 백을 사용하여 부정적 특징를 저장하고, 서로 다른 정체성 간의 특징 분리가 유도되도록 대비 손실을 적용한다.
  • 동일한 사람의 증강된 시각을 처리하기 위해 이중 브랜치 백본(예: ResNet50 또는 Swin-Transformer)을 사용하여 특징를 추출한다.
  • 데이터 크기에 비례하여 선형적으로 확장 가능하여 최대 4780만 장의 이미지까지 대규모 비디오 데이터셋에서 효율적인 학습이 가능하다.

실험 결과

연구 질문

  • RQ1대규모 레이블이 없는 비디오에서 자기지도 학습 표현 학습이 인간의 애너테이션 없이 최신 기술 수준의 도메인 일반화 가능한 인물 재식별 성능을 달성할 수 있는가?
  • RQ2단지 비디오 프레임 시퀀스만을 사용할 때 정체성 레이블이 없이 정체성 식별을 효과적으로 학습할 수 있는가?
  • RQ3노이즈가 있는 양성 쌍이 표현 학습에 미치는 영향은 무엇이며, 이러한 악영향은 어떻게 완화할 수 있는가?
  • RQ4증가하는 레이블이 없는 훈련 데이터의 양에 따라 모델의 성능이 향상되는가?
  • RQ5제안된 신뢰도 유도 대비 손실이 자기지도 학습에서 노이즈가 있는 지도 학습을 다룰 때 표준 포칼 손실보다 어떻게 우월한가?

주요 결과

  • 제로샷 도메인 일반화 설정에서 ISR은 Market-1501에서 87.0% Rank-1, MSMT17에서 56.4% Rank-1을 기록하며, 최고의 감독 학습 방법보다 각각 5.0%와 19.5% 높은 성능을 보였다.
  • Swin-Transformer 백본을 사용할 경우, ISR은 MSMT17에서 56.4% Rank-1과 30.3% mAP를 기록하여 더 큰 모델과의 확장성에서 강력한 성능을 보였다.
  • 사전 훈련 → 미세조정 설정에서 ISR은 MSMT17에서 88.4% Rank-1을 달성하여 새로운 최신 기술 수준을 수립했다.
  • Market-1501과 MSMT17 양쪽에서 데이터 크기가 증가함에 따라 성능이 계속 향상되었으며, 40960만 장의 이미지에서도 포화 현상 없이 성능 향상을 보였다.
  • 신뢰도 유도 대비 손실은 포칼 손실보다 유의미하게 뛰어난 성능을 보였으며, 신뢰도가 높은 샘플에서 학습을 유도하는 것이 하드 샘플에 가중치를 주는 것보다 더 효과적임을 확인했다.
  • t-SNE 시각화 결과 ISR은 정체성 식별 가능한 특징를 학습하고 있음을 확인했으며, 동일한 정체성의 이미지들이 서로 가까이 뭉쳐져 있는 반면, MoCo는 인스턴스 식별 가능한 특징를 학습하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.