Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid-Attention Guided Network with Multiple Resolution Features for Person Re-Identification

Guoqing Zhang, Junchuan Yang|arXiv (Cornell University)|2020. 09. 16.
Video Surveillance and Tracking Methods참고 문헌 67인용 수 5
한 줄 요약

이 논문은 다중 해상도 특징 융합을 통한 하이브리드 주의 메커니즘을 갖춘 네트워크를 제안하여, 저수준의 공간적 세부 정보와 고수준의 의미론적 정보를 결합함으로써 특징의 구분 능력을 향상시킨다. 공간 및 채널 주의 메커니즘을 다중 분해능 특징 추출 및 다중 풀링 특징 추출기와 융합함으로써, 모델은 최신 기술 수준의 성능을 달성하여 재정렬 없이 Market-1501에서 95.65%의 랭크-1 및 87.67%의 mAP를 기록한다.

ABSTRACT

Extracting effective and discriminative features is very important for addressing the challenging person re-identification (re-ID) task. Prevailing deep convolutional neural networks (CNNs) usually use high-level features for identifying pedestrian. However, some essential spatial information resided in low-level features such as shape, texture and color will be lost when learning the high-level features, due to extensive padding and pooling operations in the training stage. In addition, most existing person re-ID methods are mainly based on hand-craft bounding boxes where images are precisely aligned. It is unrealistic in practical applications, since the exploited object detection algorithms often produce inaccurate bounding boxes. This will inevitably degrade the performance of existing algorithms. To address these problems, we put forward a novel person re-ID model that fuses high- and low-level embeddings to reduce the information loss caused in learning high-level features. Then we divide the fused embedding into several parts and reconnect them to obtain the global feature and more significant local features, so as to alleviate the affect caused by the inaccurate bounding boxes. In addition, we also introduce the spatial and channel attention mechanisms in our model, which aims to mine more discriminative features related to the target. Finally, we reconstruct the feature extractor to ensure that our model can obtain more richer and robust features. Extensive experiments display the superiority of our approach compared with existing approaches. Our code is available at https://github.com/libraflower/MutipleFeature-for-PRID.

연구 동기 및 목표

  • 실세계 상황에서 정확하지도 않고 흐릿하거나 잘못 정렬된 바운딩 박스로 인한 사람 재식별 성능 저하 문제를 해결하기 위해.
  • 심층 신경망에서의 정보 손실을 줄이기 위해 컨volutional 네트워크의 여러 단계에서 다중 해상도 특징을 융합하기 위해.
  • 다중 분해능 특징 처리 및 주의 메커니즘을 통해 정밀한 바운딩 박스에 대한 의존도를 줄이기 위해.
  • 새로운 다중 풀링 특징 추출기와 하이브리드 주의 모듈을 사용하여 구분 능력 있는 특징 표현을 향상시키기 위해.

제안 방법

  • 다양한 단계의 컨volutional 네트워크에서 유도된 특징을 공간적으로 정렬하고 융합하는 다중 해상도 특징 융합 전략을 설계하여 저수준 및 고수준 표현을 모두 유지한다.
  • 공간 주의 및 채널 주의 모듈을 조합한 하이브리드 주의 메커니즘을 적용하여 눈에 띄는 영역을 강조하고 노이즈 특징을 억제한다.
  • 다중 분해능 특징 처리를 통해 특징 맵의 크기를 점진적으로 확장하여 바운딩 박스 정확도에 민감도를 낮춘다.
  • 두 가지 서로 다른 풀링 연산을 사용하는 다중 풀링 특징 추출기를 통해 다양한 특징 패턴을 캡처하고 표현 능력을 향상시킨다.
  • 특징의 구분 능력과 정체성 정렬을 동시에 최적화하기 위해 두 가지 손실 함수를 사용하여 모델을 훈련시킨다.
  • 주의 모듈은 특정 순서로 스택되며, 공간 주의를 먼저 적용하고 채널 주의를 이어하는 것이 최적의 성능을 내는 것으로 입증되었다.

실험 결과

연구 질문

  • RQ1다중 해상도 특징을 어떻게 효과적으로 융합하여 사람 재식별에서 공간적 세부 정보와 의미적 추상화를 모두 유지할 수 있는가?
  • RQ2주의 메커니즘이 실세계의 재식별 응용에서 노이즈가 많거나 잘못 정렬된 바운딩 박스의 영향을 어느 정도 줄일 수 있는가?
  • RQ3고정 파artitioning 방법과 비교해 볼 때, 다중 분해능 특징 처리가 검출 정확도 부족에 대한 강건성을 향상시키는가?
  • RQ4표준 글로벌 평균 풀링을 초월해 다중 풀링 특징 추출기가 구분 능력을 향상시킬 수 있는가?
  • RQ5공간 주의와 채널 주의 모듈을 적용할 때 최적의 순서는 무엇인가? 성능 향상이 최대가 되는 순서는?

주요 결과

  • 제안된 모델은 재정렬 없이 Market-1501 데이터셋에서 95.65%의 랭크-1 및 87.67%의 mAP를 기록하여 대부분의 최신 기술 수준 방법들을 능가한다.
  • 모든 단계(1–4)의 특징을 융합할 경우 성능이 가장 우수하며, 단일 단계 특징 대비 mAP가 20퍼센트 포인트 이상 향상된다.
  • 주의 모듈이 포함된 모델(C+S+©)은 Market-1501에서 95.7%의 랭크-1 및 87.7%의 mAP를 기록하여 하이브리드 주의의 효과를 입증한다.
  • 단지 스테이지 3 및 4 특징만을 사용해도 Market-1501에서 93.89%의 랭크-1 및 83.43%의 mAP를 기록하여 융합 범위가 제한되어도 강력한 성능을 보인다.
  • 활성화 맵을 통해 다양한 자세와 시점에서도 모델이 일관되게 구분 능력 있는 국소 영역(예: 옷차림 패턴, 신체 부위)에 집중하는 것으로 관찰된다.
  • 제거 실험을 통해 주의 모듈의 적용 순서가 중요하며, 공간 주의를 먼저 적용하고 채널 주의를 이어하는 것이 가장 우수한 성능을 내는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.