Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer Based Multi-Grained Features for Unsupervised Person Re-Identification

Jiachen Li, Menglin Wang|arXiv (Cornell University)|2022. 11. 22.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

이 논문은 비지도 학습(person re-identification)을 위한 트랜스포머 기반 이중 분기 네트워크를 제안한다. 이 네트워크는 비전 트랜스포머(Vision Transformer) 기반 모델에서 전역 및 부분 수준의 다중 해상도 특징을 추출한다. O2CAP 프레임워크를 활용해 전역 및 부분 특징에 대해 오프라인 및 온라인 대비 학습을 통합함으로써, 세 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 지도 학습 방법과의 격차를 크게 줄였다.

ABSTRACT

Multi-grained features extracted from convolutional neural networks (CNNs) have demonstrated their strong discrimination ability in supervised person re-identification (Re-ID) tasks. Inspired by them, this work investigates the way of extracting multi-grained features from a pure transformer network to address the unsupervised Re-ID problem that is label-free but much more challenging. To this end, we build a dual-branch network architecture based upon a modified Vision Transformer (ViT). The local tokens output in each branch are reshaped and then uniformly partitioned into multiple stripes to generate part-level features, while the global tokens of two branches are averaged to produce a global feature. Further, based upon offline-online associated camera-aware proxies (O2CAP) that is a top-performing unsupervised Re-ID method, we define offline and online contrastive learning losses with respect to both global and part-level features to conduct unsupervised learning. Extensive experiments on three person Re-ID datasets show that the proposed method outperforms state-of-the-art unsupervised methods by a considerable margin, greatly mitigating the gap to supervised counterparts. Code will be available soon at https://github.com/RikoLi/WACV23-workshop-TMGF.

연구 동기 및 목표

  • 정체성 레이블이 부족한 비지도 학습 환경에서 실세계 적용을 위해 높은 분류 능력을 요구하는 비지도 학습(person re-identification) 문제를 해결한다.
  • 감독 학습 기반의 CNN 기반 다중 해상도 네트워크를 영감으로 삼아, 순수 트랜스포머 백본이 다중 해상도 특징을 효과적으로 추출할 수 있는 잠재력을 탐색한다.
  • 백본을 수정하지 않고도 비전 트랜스포머에서 동시에 전역 및 부분 수준 특징을 학습할 수 있도록 이중 분기 아키텍처를 설계한다.
  • O2CAP 프레임워크를 활용해 전역 및 부분 수준 특징에 대해 오프라인 및 온라인 대비 손실을 정의함으로써 비지도 학습을 향상시킨다.
  • 레이블이 없는 환경에서 다중 해상도 특징을 효과적으로 활용함으로써, 비지도 학습과 지도 학습 Re-ID 간의 성능 격차를 줄인다.

제안 방법

  • 비지도 학습 Re-ID를 위한 특징 추출 백본으로 사용하기 위해, 수정된 비전 트랜스포머(ViT)인 TransReID-SSL 백본을 적응시킨다.
  • 최종 트랜스포머 레이어를 복제하여 각 분기별로 독립적인 출력을 생성함으로써 이중 분기 네트워크를 구성하고, 병렬 특징 학습을 가능하게 한다.
  • 각 분기에서 유닛으로 나누어진 국소 토큰을 수평 스트립으로 재형성하여 부분 수준 특징을 추출한다.
  • 양 분기의 전역 토큰을 평균하여 단일 전역 특징 표현을 생성한다.
  • O2CAP 프레임워크를 통합하여 전역 및 부분 수준 특징에 대해 오프라인 및 온라인 대비 학습 손실을 정의함으로써, 가짜 레이블을 개선하고 표현 학습을 향상시킨다.
  • 카메라 인식 프oxy와 관련 클러스터링을 활용해 정체성 감독 없이도 대비 학습을 안내한다.

실험 결과

연구 질문

  • RQ1순수 트랜스포머 기반 Re-ID 백본에서 비지도 설정에서 다중 해상도 특징을 효과적으로 추출할 수 있는가?
  • RQ2전역 특징만 사용하는 것과 비교해 전역 및 부분 수준의 대비 학습을 통합함으로써 비지도 학습 person Re-ID 성능이 향상되는가?
  • RQ3비전 트랜스포머에 적용된 이중 분기 아키텍처가 세분화된 특징과 장거리 맥락적 정보를 효율적으로 포착할 수 있는가?
  • RQ4트랜스포머 기반 비지도 학습 Re-ID 모델이 지도 학습 대비 성능 격차를 어느 정도 줄일 수 있는가?
  • RQ5다양한 벤치마크에서 제안된 방법이 최신 기술 수준의 비지도 학습 Re-ID 방법과 mAP 및 Rank-1 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • MSMT17에서 제안된 방법은 76.8% mAP와 92.9% Rank-1을 달성하여, 이전의 SOTA 비지도 학습 방법인 O2CAP를 mAP 15.8%p, Rank-1 11.3%p 높게 기록했다.
  • Market-1501에서 방법은 89.5% mAP와 95.5% Rank-1을 기록했으며, 지도 학습 ABD-Net에 근소한 격차로 앞서며 여러 다른 지도 학습 방법을 초월했다.
  • 정답 레이블을 사용해 훈련한 모델은 Market-1501에서 91.9% mAP와 96.3% Rank-1을 기록했으며, 이는 다중 해상도 특징 추출 기법이 매우 효과적임을 보여주며 최신 기술 수준의 지도 학습 모델과 경쟁 가능함을 시사한다.
  • 성능 향상이 가장 두드러진 것은 가장 도전적인 MSMT17 데이터셋에서이며, 이 경우 TransReID-SSL(이전 SOTA 트랜스포머 기반 비지도 학습 방법) 대비 mAP 7.6%p, Rank-1 8.3%p 향상되었다.
  • 제거 실험(ablation study) 결과, 전역 및 부분 수준의 대비 학습 손실 모두 성능 향상에 기여하며, 특히 부분 수준의 지도 학습이 가장 큰 기여를 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.