Skip to main content
QUICK REVIEW

[논문 리뷰] HAT: Hierarchical Aggregation Transformers for Person Re-identification

Guowen Zhang, Pingping Zhang|arXiv (Cornell University)|2021. 07. 13.
Video Surveillance and Tracking Methods참고 문헌 60인용 수 14
한 줄 요약

HAT는 CNN 기반의 다중 척도 특징 추출과 Transformer 기반의 특징 캘리브레이션(TFC) 모듈, 그리고 딥리 서포트드 어그리게이션(ตร) 메커니즘을 결합하여 사람 재식별을 위한 새로운 계층적 집계 트랜스포머를 제안한다. 이 방법은 다중 해상도 감시와 함께 계층적 특징을 반복적으로 융합하고, 저수준의 세부 정보를 고수준 의미론적 특징에 대한 전반적 사전 지식으로 통합함으로써 네 개의 대규모 Re-ID 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recently, with the advance of deep Convolutional Neural Networks (CNNs), person Re-Identification (Re-ID) has witnessed great success in various applications. However, with limited receptive fields of CNNs, it is still challenging to extract discriminative representations in a global view for persons under non-overlapped cameras. Meanwhile, Transformers demonstrate strong abilities of modeling long-range dependencies for spatial and sequential data. In this work, we take advantages of both CNNs and Transformers, and propose a novel learning framework named Hierarchical Aggregation Transformer (HAT) for image-based person Re-ID with high performance. To achieve this goal, we first propose a Deeply Supervised Aggregation (DSA) to recurrently aggregate hierarchical features from CNN backbones. With multi-granularity supervisions, the DSA can enhance multi-scale features for person retrieval, which is very different from previous methods. Then, we introduce a Transformer-based Feature Calibration (TFC) to integrate low-level detail information as the global prior for high-level semantic information. The proposed TFC is inserted to each level of hierarchical features, resulting in great performance improvements. To our best knowledge, this work is the first to take advantages of both CNNs and Transformers for image-based person Re-ID. Comprehensive experiments on four large-scale Re-ID benchmarks demonstrate that our method shows better results than several state-of-the-art methods. The code is released at https://github.com/AI-Zhpp/HAT.

연구 동기 및 목표

  • 비겹치는 카메라 시야에서 CNN의 수신 영역가 제한된 문제를 해결하기 위해.
  • CNN 기반 백본에서 유도된 다중 척도 계층적 특징을 효과적으로 융합하여 특징 표현을 향상시키기 위해.
  • 트랜스포머의 전반적 모델링 능력을 활용하여 의미 이해를 향상시키면서도 저수준 세부 정보를 유지하기 위해.
  • 백본 선택에 의존하지 않고 다양한 Re-ID 시나리오에 대해 강건한 학습 가능한 프레임워크를 설계하기 위해.
  • 다중 해상도 감시와 특징 캘리브레이션의 효과를 입증하여 분류 가능한 특징 학습을 향상시키기 위해.

제안 방법

  • 다중 해상도 감시를 사용하여 CNN 백본의 계층적 특징을 반복적으로 융합하는 딥리 서포트드 어그리게이션(ตร)을 제안한다.
  • 각 계층에서 저수준 세부 정보 특징을 고수준 의미론적 특징에 대한 전반적 사전 지식으로 통합하는 트랜스포머 기반의 특징 캘리브레이션(TFC) 모듈을 도입한다.
  • TFC 내에서 효과적인 수준 간 상호작용을 위해 다중 척도 특징을 일관된 해상도(H/d, W/d)로 조정하기 위한 스케일링 모듈을 사용한다.
  • 기울기 흐름 향상, 의미 정보 유지, 정규화 제공를 위해 여러 단계에서 보조 손실을 적용한다.
  • 국소적 특징 표현을 개선하고 분류 능력을 향상시키기 위해 이웃 조정(NeA)을 적용한다.
  • 얕은 층에서 깊은 층으로 특징을 처리하는 계층적 융합 파이프라인을 설계하여 점진적으로 표현을 정교화한다.

실험 결과

연구 질문

  • RQ1CNN 백본에서 유도된 다중 척도 특징을 어떻게 효과적으로 융합하여 사람 재식별 성능을 향상시킬 수 있는가?
  • RQ2트랜스포머 기반 메커니즘이 저수준 세부 정보를 고수준 의미론적 특징에 대한 전반적 사전 지식으로 통합함으로써 특징 표현을 향상시킬 수 있는가?
  • RQ3다중 해상도 감시는 계층적 특징 융합에서 특징 학습과 모델 일반화에 어떤 영향을 미치는가?
  • RQ4특징 해상도의 스케일링이 TFC 모듈 내 수준 간 특징 상호작용 성능에 어떤 영향을 미치는가?
  • RQ5제안된 HAT 프레임워크는 표준 Re-ID 벤치마크에서 기존 최신 기술 수준의 방법들을 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • HAT는 네 개의 대규모 Re-ID 벤치마크에서 최신 기술 수준의 성능을 달성한다: Market1501 (mAP: 95.8%, Rank-1: 95.8%), DukeMTMC (mAP: 81.4%, Rank-1: 90.4%), CUHK03 (mAP: 88.9%, Rank-1: 95.5%), 및 MSMT1271 (mAP: 84.5%, Rank-1: 93.0%).
  • 제거 실험 결과, 다중 척도 특징 추출(MFE)에 대한 감시를 제거할 경우 mAP가 4.9% 감소하고 Rank-1이 2.2% 감소함을 확인하여 깊은 감시의 중요성을 입증한다.
  • λ = 0.5일 때 보조 손실이 최고 성능(81.4% mAP, 90.4% Rank-1, DukeMTMC 기준)을 기록하며, 더 높거나 낮은 λ 값보다 뛰어난 성능을 보였다.
  • d=16로 스케일링할 경우 d=8 또는 d=32보다 더 뛰어난 성능를 기록하여 중간 해상도가 관련 특징을 유지하면서 노이즈를 유도하지 않는다는 것을 시사한다.
  • 시각화 결과는 HAT가 기준 모델 대비 더 많은 분류 가능한 세부 정보—예를 들어 가방 무늬나 옷 텍스처—를 포착함을 확인한다.
  • TFC 모듈은 얕은 층에서 깊은 층으로 갈수록 특징 품질을 점진적으로 향상시키며, 평균 특징 맵을 통해 고수준에서 더 높은 분류 능력을 가진 내용을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.