Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Scale Pre-training for Person Re-identification with Noisy Labels

Dengpan Fu, Dongdong Chen|arXiv (Cornell University)|2022. 03. 30.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

이 논문은 LUPerson 데이터셋의 비디오 트랙렛에서 유도된 노이즈 있는 레이블을 사용하여 개인 재식별(Person Re-Identification)을 위한 대규모 사전 훈련 프레임워크인 PNL을 제안한다. 감독 학습, 프로토타입 기반의 대비 학습, 레이블 유도 대비 학습을 공동 최적화함으로써 PNL은 효과적으로 노이즈 있는 레이블을 교정하고 강력한 표현을 학습하여 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, CUHK03에서 ImageNet 사전 훈련 대비 5.7% mAP 향상을 기록하고 소수의 샘플 설정에서도 뚜렷한 성능 향상을 보였다.

ABSTRACT

This paper aims to address the problem of pre-training for person re-identification (Re-ID) with noisy labels. To setup the pre-training task, we apply a simple online multi-object tracking system on raw videos of an existing unlabeled Re-ID dataset "LUPerson" nd build the Noisy Labeled variant called "LUPerson-NL". Since theses ID labels automatically derived from tracklets inevitably contain noises, we develop a large-scale Pre-training framework utilizing Noisy Labels (PNL), which consists of three learning modules: supervised Re-ID learning, prototype-based contrastive learning, and label-guided contrastive learning. In principle, joint learning of these three modules not only clusters similar examples to one prototype, but also rectifies noisy labels based on the prototype assignment. We demonstrate that learning directly from raw videos is a promising alternative for pre-training, which utilizes spatial and temporal correlations as weak supervision. This simple pre-training task provides a scalable way to learn SOTA Re-ID representations from scratch on "LUPerson-NL" without bells and whistles. For example, by applying on the same supervised Re-ID method MGN, our pre-trained model improves the mAP over the unsupervised pre-training counterpart by 5.7%, 2.2%, 2.3% on CUHK03, DukeMTMC, and MSMT17 respectively. Under the small-scale or few-shot setting, the performance gain is even more significant, suggesting a better transferability of the learned representation. Code is available at https://github.com/DengpanFu/LUPerson-NL

연구 동기 및 목표

  • 대규모 고품질 레이블이 부족한 개인 재식별(Re-ID) 문제를 해결하기 위해 원시 비디오 데이터를 확장 가능한 사전 훈련 소스로 활용하는 것.
  • 일반적인 ImageNet 사전 훈련과 개인 중심의 Re-ID 작업 간의 도메인 갭을 줄이기 위해 웹 스케일의 레이블이 없는 비디오에서 학습하는 것.
  • 노이즈 있는 레이블, 프로토타입, 교정된 레이블을 함께 학습하여 표현 학습을 향상시키는 통합된 사전 훈련 프레임워크를 개발하는 것.
  • 공간-시간적 비디오 상관관계에서 유도된 약한 감독이 ImageNet 또는 비감독 사전 훈련보다 우수한 Re-ID 특징을 생성할 수 있는지 검증하는 것.

제안 방법

  • 21,000개의 장면에서 유도된 다중 객체 추적을 통해 유사 레이블을 도출한 1,000만 장의 이미지로 구성된 대규모 Re-ID 데이터셋인 LUPerson-NL을 구축한다.
  • 세 모듈로 구성된 사전 훈련 프레임워크를 도입: 감독 분류 손실, 동적으로 업데이트되는 중심점(centroids)을 사용하는 프로토타입 기반 대비 학습, 교정된 레이블을 사용하는 레이블 유도 대비 학습.
  • 클러스터링의 안정성 향상과 레이블 교정 향상을 위해 프로토타입 중심점에 대해 이동 평균 업데이트를 적용한다.
  • 프로토타입 할당 일관성과 교정된 레이블 신뢰도를 엔드 투 엔드 훈련을 통해 강제하는 공동 최적화 기반의 학습 방식을 사용한다.
  • 특징 유사도 행렬을 활용해 레이블 교정을 시각화하고 검증하며, 잘못된 레이블이 부여된 개체군의 클러스터링 향상을 입증한다.
  • 후처리 없이 표준 기준 모델(MGN, IDE 등)을 사용하여 공정한 비교를 위해 사전 훈련된 모델을 최종 Re-ID 작업에 그대로 적용한다.

실험 결과

연구 질문

  • RQ1자동으로 유도된 노이즈 있는 레이블을 사용한 원시 비디오에서의 대규모 사전 훈련이 ImageNet 사전 훈련보다 개인 재식별에서 더 나은 성능을 내는가?
  • RQ2감독 학습, 프로토타입 기반 대비 학습, 레이블 유도 대비 학습을 공동으로 학습하는 방식이 노이즈 있는 레이블을 교정하고 표현 학습을 향상시키는 데 얼마나 효과적인가?
  • RQ3공간적·시간적 상관관계를 활용한 비디오 트랙렛에서의 약한 감독이 비감독 또는 감독 사전 훈련보다 더 나은 전이 가능한 특징을 생성하는가?
  • RQ4소규모 데이터나 소수 샘플 설정에서 제안된 PNL 프레임워크가 성능 향상에 얼마나 기여하는가?
  • RQ5레이블 교정과 대비 학습을 통합한 단일 프레임워크가 추가 기능 없이도 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • PNL 사전 훈련 모델은 CUHK03에서 ImageNet 감독 사전 훈련 대비 mAP 5.7% 향상되었으며, DukeMTMC에서는 2.2%, MSMT17에서는 2.3% 향상되었다.
  • 소규모 및 소수 샘플 설정에서 PNL 사전 훈련의 성능 향상은 더욱 두드러지며, 이는 뛰어난 전이 능력을 시사한다.
  • 레이블 교정 메커니즘이 동일한 사람의 잘못된 레이블이 부여된 트랙렛(Noise-I)을 성공적으로 통합하고, 잘못 함께 묶인 다른 신원(Noise-II)을 분리함을 시각화 행렬을 통해 입증하였다.
  • 절단 실험을 통해 레이블 교정이 성능 향상에 크게 기여하며, MSMT17에서 레이블 교정을 포함할 경우 mAP 1.3% 향상됨을 확인하였다.
  • 모든 네 가지 벤치마크(CUHK03, Market1501, DukeMTMC, MSMT17)에서 PNL 기반 모델은 후처리 없이도 최신 기술 수준 성능을 달성하였으며, 이는 이전 방법들에 비해 뚜렷한 우위를 보였다.
  • MGN 기반으로 MSMT17에서 68.0/86.0 mAP, Market1501에서 91.9/96.6 mAP를 기록하여 이전 SOTA를 크게 앞서며 높은 성능을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.