Skip to main content
QUICK REVIEW

[논문 리뷰] NFormer: Robust Person Re-identification with Neighbor Transformer

Haochen Wang, Jiayi Shen|UvA-DARE (University of Amsterdam)|2022. 04. 20.
Video Surveillance and Tracking Methods인용 수 15
한 줄 요약

NFormer는 훈련 및 추론 중에 모든 입력 이미지 간의 상호관계를 모델링하는 이웃 트랜스포머 네트워크를 제안하여 이상치 특징을 억제하고 인물 재식별(person re-identification)의 정확도를 향상시킨다. 효율적인 유사도 계산을 위한 랜드마크 에이전트 어텐션(Landmark Agent Attention)과 희박하고 관련성이 높은 어텐션을 보장하는 상호 이웃 소프트맥스(Reciprocal Neighbor Softmax)를 도입함으로써, NFormer는 네 가지 대규모 Re-ID 데이터셋에서 최신 기준(SOTA) 성능을 달성하여 이전 방법 대비 최대 4.4% 향상된 mAP 성능을 기록한다.

ABSTRACT

Person re-identification aims to retrieve persons in highly varying settings across different cameras and scenarios, in which robust and discriminative representation learning is crucial. Most research considers learning representations from single images, ignoring any potential interactions between them. However, due to the high intra-identity variations, ignoring such interactions typically leads to outlier features. To tackle this issue, we propose a Neighbor Transformer Network, or NFormer, which explicitly models interactions across all input images, thus suppressing outlier features and leading to more robust representations overall. As modelling interactions between enormous amount of images is a massive task with lots of distractors, NFormer introduces two novel modules, the Landmark Agent Attention, and the Reciprocal Neighbor Softmax. Specifically, the Landmark Agent Attention efficiently models the relation map between images by a low-rank factorization with a few landmarks in feature space. Moreover, the Reciprocal Neighbor Softmax achieves sparse attention to relevant -- rather than all -- neighbors only, which alleviates interference of irrelevant representations and further relieves the computational burden. In experiments on four large-scale datasets, NFormer achieves a new state-of-the-art. The code is released at \url{https://github.com/haochenheheda/NFormer}.

연구 동기 및 목표

  • 오염, 시야각 변화, 의복 변화 등으로 인한 고유한 정체성 내 변화를 해결하기 위해.
  • 기존 방법이 훈련 배치 내에서만 관계를 모델링하거나 이미지 간 상호작용을 완전히 忽略하는 한계를 극복하기 위해.
  • 훈련 및 추론 중에 모든 입력 이미지 간의 관계를 명시적으로 모델링하여 강건한 표현 학습을 가능하게 하기 위해.
  • 전체 유사도 행렬을 효율적으로 근사하고 관련성이 높은 이웃에 집중함으로써 대규모 Re-ID에서 계산 비용을 줄이기 위해.
  • 기존 Re-ID 모델의 아키텍처를 대대적으로 수정하지 않고도 통합 가능한 플러그 앤 플레이 모듈을 개발하기 위해.

제안 방법

  • 특징 공간 내 소수의 랜드마크 에이전트를 사용하여 전체 유사도 행렬을 인수분해함으로써, 이중 차수 복잡도를 랜드마크 수에 선형으로 줄이는 Landmark Agent Attention (LAA)을 도입한다.
  • 서로 유사한 이웃에만 희박한 어텐션을 적용함으로써, 관련이 없는 표현으로부터 간섭을 최소화하는 상호 이웃 소프트맥스(RNS)를 활용한다.
  • 낮은 랭크 인수분해를 통한 강화된 자기어텐션 메커니즘을 사용하여 모든 입력 이미지 표현 간의 글로벌 관계 지도를 구성한다.
  • 관계 모델링 및 집계 후 최종 특징을 추출하기 위해 글로벌 평균 풀링을 적용한다.
  • 학습된 유사도 기반으로 이웃 이미지 간에 반복적인 메시지 전달을 통해 특징를 개선하는 이중 브랜치 아키텍처를 적용한다.
  • 훈련 및 추론 전반에 걸쳐 모든 이미지 간 상호작용을 완전히 구현함으로써, 훈련과 추론 시 행동 간 격차를 해소한다.

실험 결과

연구 질문

  • RQ1훈련 및 추론 중에 모든 입력 이미지 간의 상호관계를 모델링함으로써 인물 재식별의 정확도를 향상시킬 수 있는가?
  • RQ2전체 쌍방향 유사도 모델링의 계산 비용을 표현 품질을 훼손하지 않고 어떻게 줄일 수 있는가?
  • RQ3관련성이 높은 이웃에만 집중하는 희박한 어텐션은 특징의 분류 능력을 향상시키고 노이즈를 줄일 수 있는가?
  • RQ4제안된 방법은 다양한 Re-ID 벤치마크(정체성 당 평균 이미지 수가 다른 경우)에 일반화 가능한가?
  • RQ5NFormer는 기존 최신 기준(SOTA) 모델과 얼마나 잘 통합되어 성능을 추가로 향상시킬 수 있는가?

주요 결과

  • NFormer는 ResNet-50와 결합했을 때 Market-1501에서 94.7% mAP 및 91.1% 상위-1 정확도를 달성하여 새로운 최고 기록을 수립했다.
  • DukeMTMC-reID에서 NFormer는 ResNet-50를 사용했을 때 두 번째로 우수한 성능을 기록한 ISP 방법 대비 mAP 3.5% 향상시켰다.
  • MSMT17에서 NFormer는 ResNet-50를 사용했을 때 83.5% mAP를 기록하여 두 번째로 뛰어난 방법인 RGA-SC보다 2.3% 높은 성능을 기록했다.
  • CUHK03에서 NFormer는 수동 레이블링 세트에서 기준 모델 대비 mAP 4.2% 향상되었고, 탐지된 세트에서는 3.5% 향상되었다.
  • ABDNet와 결합했을 때 NFormer는 Market-1501에서 95.7% mAP를 달성하여 두 번째로 뛰어난 방법보다 mAP 1.9% 높고 상위-1 정확도 1.0% 높은 성능을 기록했다.
  • 절단 분석 결과, NFormer의 성능 향상은 정체성 당 평균 이미지 수가 높은 데이터셋에서 가장 두드러지게 나타나, 이웃 정보 활용 능력이 뛰어나다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.