Skip to main content
QUICK REVIEW

[논문 리뷰] Part-Aware Transformer for Generalizable Person Re-identification

Hao Ni, Yuke Li|arXiv (Cornell University)|2023. 08. 07.
Video Surveillance and Tracking MethodsComputer Science인용 수 3
한 줄 요약

이 논문은 도메인 일반화(person re-identification, DG-ReID)를 위한 비전 트랜스포머 기반 모델인 Part-Aware Transformer을 제안한다. Cross-ID Similarity Learning (CSL)을 도입하여 서로 다른 신원 간의 ID에 관계없는 국소적 시각적 유사성을 탐색함으로써 도메인 특화된 편향에 대한 과적합을 줄이고, Part-guided Self-Distillation (PSD)을 활용해 글로벌 특징의 일반화 능력을 향상시킨다. 제안된 방법은 최신 기준 성능을 달성하여 Market→Duke 설정에서 Rank-1을 10.9% 향상시키고 mAP를 12.8% 향상시켰다.

ABSTRACT

Domain generalization person re-identification (DG-ReID) aims to train a model on source domains and generalize well on unseen domains. Vision Transformer usually yields better generalization ability than common CNN networks under distribution shifts. However, Transformer-based ReID models inevitably over-fit to domain-specific biases due to the supervised learning strategy on the source domain. We observe that while the global images of different IDs should have different features, their similar local parts (e.g., black backpack) are not bounded by this constraint. Motivated by this, we propose a pure Transformer model (termed Part-aware Transformer) for DG-ReID by designing a proxy task, named Cross-ID Similarity Learning (CSL), to mine local visual information shared by different IDs. This proxy task allows the model to learn generic features because it only cares about the visual similarity of the parts regardless of the ID labels, thus alleviating the side effect of domain-specific biases. Based on the local similarity obtained in CSL, a Part-guided Self-Distillation (PSD) is proposed to further improve the generalization of global features. Our method achieves state-of-the-art performance under most DG ReID settings. Under the Market$ o$Duke setting, our method exceeds state-of-the-art by 10.9% and 12.8% in Rank1 and mAP, respectively. The code is available at https://github.com/liyuke65535/Part-Aware-Transformer.

연구 동기 및 목표

  • 미래의 도메인에서의 도메인 분포 변화 문제를 해결하기 위해, 새로운 도메인에서도 일반화 능력이 뛰어난 모델을 개선하는 것.
  • 비전 트랜스포머 기반 ReID 모델에서 도메인 특화된 편향에 대한 과적합을 줄이는 것.
  • 다양한 신원 간의 내재된 시각적 유사성을 활용해 일반적이고 ID에 관계없는 국소적 시각적 표현을 학습하는 것.
  • 국소적 파트 유사성에 기반한 새로운 자기 정규화 전략을 통해 글로벌 특징의 일반화 능력을 향상시키는 것.
  • 사람 재식별에서 도메인 일반화를 위한 순수한 트랜스포머 기반 프레임워크를 수립하는 것.

제안 방법

  • ID 레이블을 사용하지 않고 서로 다른 신원 간의 국소 이미지 파트 간의 시각적 유사성을 탐색하는 프록시 태스크인 Cross-ID Similarity Learning (CSL)을 도입한다.
  • 지역화된 표현을 생성하기 위해 영역 관심 영역 내에서 파트 토큰과 이미지 패치를 연결하는 파트 인식 주의(attention)를 활용한다.
  • 기존의 모든 샘플과의 유사도를 계산하기 위해 메모리 백을 사용하여 서로 다른 신원 간의 시각적으로 유사한 파트를 식별한다.
  • CSL의 유사도 결과를 활용해 소프트 레이블을 구성하고, 이를 통해 글로벌 특징 학습을 이끄는 Part-guided Self-Distillation (PSD)을 제안한다.
  • 학습 안정성 향상과 국소 표현 공간 내 특징 클러스터링 향상을 위해 온도 조절 기반 소프트맥스-클러스터링 손실을 적용한다.
  • 얕은 레이어의 주의 맵을 융합하여 시각화하고, 파트 토큰이 배낭, 코트와 같은 분류에 유용한 국소 영역에 집중하고 있음을 검증한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머 기반 모델이 CNN보다 도메인 일반화 사람 재식별에서 더 나은 일반화 성능을 달성할 수 있는가?
  • RQ2ID에 관계없는 국소적 시각적 유사성 학습이 도메인 분포 변화 상황에서 재식별의 일반화 능력을 향상시키는가?
  • RQ3다른 신원 간의 시각적 유사성에 기반한 프록시 태스크가 지도 학습에서 도메인 특화된 편향에 대한 과적합을 줄일 수 있는가?
  • RQ4국소적 파트 유사성에 기반한 자기 정규화가 세분화된 재식별 과제에서 기존 자기 정규화보다 성능이 뛰어나게 되는가?
  • RQ5파트 토큰의 수와 온도 하이퍼파rameter는 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 Part-Aware Transformer는 Market→Duke, Market→CUHK03-NP, Market→MSMT를 포함한 여러 DG-ReID 벤치마크에서 최신 기준 성능을 달성한다.
  • Market→Duke 설정에서 이전 최신 기준 성능 대비 Rank-1 정확도를 10.9% 향상시키고, mAP를 12.8% 향상시켰다.
  • CSL 모듈만으로도 성능 향상이 뚜렷하게 나타나, ID에 관계없는 국소 유사성 학습의 효과를 입증한다.
  • Part-guided Self-Distillation (PSD)는 일반화 능력을 추가로 향상시키며, 세분화된 ReID에서 성능이 저하되는 기존 자기 정규화보다 뛰어난 성능을 보였다.
  • 최적의 온도 하이퍼파rameter τ = 0.02는 Market 데이터셋에서 최고의 성능을 내며, 매우 낮거나 높은 값에서는 불안정성이 관찰되었다.
  • 이미지를 세 부분으로 나누는 것이 가장 뛰어난 성능을 내었으며, 더 많은 또는 더 적은 파트로 나누는 것은 미미한 성능 향상에 그치며, 중간 수준의 파트 토큰 수가 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.