Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-Supervised Domain Generalizable Person Re-Identification

Lingxiao He, Wu Liu|arXiv (Cornell University)|2021. 08. 11.
Video Surveillance and Tracking Methods참고 문헌 53인용 수 9
한 줄 요약

이 논문은 300만+ 이미지를 포함한 약한 레이블이 부여된 YouTube-Human 데이터와 17개의 레이블된 데이터셋을 활용하여 도메인 일반화 가능한 인물 재식별 모델을 훈련하는 준지도 학습 지식 정련(SSKD) 프레임워크를 제안한다. 비라벨 데이터로부터 소프트 가짜 레이블을 생성하는 테이처-스터디 정련 설정을 통해 SSKD는 Market1501, DukeMTMC, MSMT17와 같은 새로운 타겟 도메인에서 지도 학습과 유사한 성능을 달성하며, 새로운 도메인의 레이블 데이터가 필요 없이 일반화 능력을 크게 향상시킨다.

ABSTRACT

Existing person re-identification (re-id) methods are stuck when deployed to a new unseen scenario despite the success in cross-camera person matching. Recent efforts have been substantially devoted to domain adaptive person re-id where extensive unlabeled data in the new scenario are utilized in a transductive learning manner. However, for each scenario, it is required to first collect enough data and then train such a domain adaptive re-id model, thus restricting their practical application. Instead, we aim to explore multiple labeled datasets to learn generalized domain-invariant representations for person re-id, which is expected universally effective for each new-coming re-id scenario. To pursue practicability in real-world systems, we collect all the person re-id datasets (20 datasets) in this field and select the three most frequently used datasets (i.e., Market1501, DukeMTMC, and MSMT17) as unseen target domains. In addition, we develop DataHunter that collects over 300K+ weak annotated images named YouTube-Human from YouTube street-view videos, which joins 17 remaining full labeled datasets to form multiple source domains. On such a large and challenging benchmark called FastHuman (~440K+ labeled images), we further propose a simple yet effective Semi-Supervised Knowledge Distillation (SSKD) framework. SSKD effectively exploits the weakly annotated data by assigning soft pseudo labels to YouTube-Human to improve models' generalization ability. Experiments on several protocols verify the effectiveness of the proposed SSKD framework on domain generalizable person re-id, which is even comparable to supervised learning on the target domains. Lastly, but most importantly, we hope the proposed benchmark FastHuman could bring the next development of domain generalizable person re-id algorithms.

연구 동기 및 목표

  • 인물 재식별에서 새로운 배포 도메인의 레이블 데이터가 필요로 하는 실용적 제약를 해결하기 위해.
  • 도메인 특화 미세조정에 의존하지 않고도 새로운 도메인으로의 일반화 능력을 향상시키기 위해.
  • 실생활 시나리오에서 유래한 다양한 440만+ 장면을 포함한 대규모 스케일의 벤치마크(FastHuman)를 개발하기 위해.
  • 약한 레이블이 부여된 웹 데이터(YouTube-Human)가 준지도 학습 지식 정련을 통해 도메인 일반화 능력을 향상시키는 데 효과적인지 탐색하기 위해.
  • 도메인 일반화 가능한 인물 재식별 분야의 연구를 가속화하기 위해 새로운 벤치마크와 코드베이스를 제공하기 위해.

제안 방법

  • 비라벨된 YouTube-Human 데이터에서 소프트 가짜 레이블을 생성하는 테이처 모델을 활용하여 레이블된 데이터와 함께 학생 모델을 훈련하는 준지도 학습 지식 정련 프레임워크(SSKD)를 제안한다.
  • 테이처 모델(예: ResNet-101 또는 ResNeSt-269)을 사용해 비라벨된 YouTube-Human 이미지에 대한 소프트 예측을 생성하고, 이를 학생 모델의 지도 학습에 활용한다.
  • 이중 지도 학습 전략을 구현: 학생 모델은 레이블된 데이터의 하드 레이블과 비라벨 데이터에 대한 테이처 모델의 예측 결과인 소프트 레이블을 동시에 활용해 훈련된다.
  • 희소 코딩을 통한 특징 재구성 방식인 공간 재구성 헤드(Disentangled Spatial Reconstruction, DSR)를 도입하여 특징의 분류 능력을 향상시키고, 가림과 도메인 이동에 대한 강건성을 향상시킨다.
  • 17개의 레이블된 데이터셋과 YouTube-Human 데이터를 융합하여 총 440만+ 장면, 82대의 카메라, 38,000명 이상의 주체를 포함하는 대규모 벤치마크인 FastHuman을 구축한다.
  • YouTube 스트리트 뷰 영상에서 약한 레이블이 부여된 인물 이미지를 자동으로 수집할 수 있는 DataHunter 시스템을 개발하여 도메인 일반화를 위한 스케일러블한 데이터 수집을 가능하게 한다.

실험 결과

연구 질문

  • RQ1YouTube에서 유래한 약한 레이블이 부여된 웹 데이터가 인물 재식별 모델의 도메인 일반화 능력을 향상시키는가?
  • RQ2비라벨 데이터를 활용하는 준지도 학습 지식 정련이 도메인 특화 미세조정 없이도 새로운 타겟 도메인으로의 일반화 능력을 향상시키는 데 얼마나 효과적인가?
  • RQ3SSKD 프레임워크에서 학생 모델의 일반화 성능에 영향을 미치는 모델 용량(예: 테이처 네트워크의 깊이)은 어떠한가?
  • RQ4비라벨 데이터의 크기가 재식별 모델의 일반화 능력에 어떤 영향을 미치는가?
  • RQ5FastHuman과 같은 대규모이고 다양한 이미지를 포함한 벤치마크가 도메인 일반화 가능한 인물 재식별 연구를 효과적으로 지원하고 가속화할 수 있는가?

주요 결과

  • ResNeSt-269를 테이처 모델로 사용할 경우 SSKD는 Market1501에서 90.86%의 랭크-1 정확도, MSMT17에서 57.35%를 기록하며 표준 지식 정련 및 자기지도 학습 기반 모델을 능가한다.
  • SSKD+DSR 버전은 SSKD 대비 PartialREID에서 2.70% 향상되고 CrowdReID에서 2.00% 향상되어 공간적 특징 재구성의 유용성을 입증한다.
  • ResNeSt-269를 테이처 모델로 사용할 경우, 더 작은 ResNet-50 테이처 모델에서 정련하는 것에 비해 CrowdReID에서 최대 4.56% 향상된 성능을 기록한다.
  • 비라벨 데이터에 대한 지식 정련에서 최적의 온도 하이퍼파rameter는 τᵤᵏ = 6이며, 이 경우 Market1501에서 89.3%, DukeMTMC에서 78.4%의 랭크-1 정확도를 달성한다.
  • 비라벨된 YouTube-Human 데이터의 크기를 늘일수록 일반화 능력이 지속적으로 향상되며, 더 많은 데이터를 사용할수록 성능이 향상된다.
  • 제안된 FastHuman 벤치마크는 20개의 다양한 데이터셋과 300만+ 장의 YouTube-Human 이미지를 포함하여, 실제 시나리오에서의 도메인 일반화 능력 평가에 강력한 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.