Skip to main content
QUICK REVIEW

[論文レビュー] NFormer: Robust Person Re-identification with Neighbor Transformer

Haochen Wang, Jiayi Shen|UvA-DARE (University of Amsterdam)|Apr 20, 2022
Video Surveillance and Tracking Methods被引用数 15
ひとこと要約

NFormerは、トレーニング時および推論時において、すべての入力画像間の関係をモデル化するネイバー・トランスフォーマー・ネットワークを提案する。これにより、外れ特徴を抑制し、person re-identificationにおけるロバスト性を向上させる。Landmark Agent Attentionを導入して効率的な類似度計算を実現し、Reciprocal Neighbor Softmaxによりスパースで関連のある注目を実現することで、NFormerは4つの大規模なRe-IDデータセットで最先端の性能を達成し、従来手法に比べてmAPで最大4.4%の向上を達成した。

ABSTRACT

Person re-identification aims to retrieve persons in highly varying settings across different cameras and scenarios, in which robust and discriminative representation learning is crucial. Most research considers learning representations from single images, ignoring any potential interactions between them. However, due to the high intra-identity variations, ignoring such interactions typically leads to outlier features. To tackle this issue, we propose a Neighbor Transformer Network, or NFormer, which explicitly models interactions across all input images, thus suppressing outlier features and leading to more robust representations overall. As modelling interactions between enormous amount of images is a massive task with lots of distractors, NFormer introduces two novel modules, the Landmark Agent Attention, and the Reciprocal Neighbor Softmax. Specifically, the Landmark Agent Attention efficiently models the relation map between images by a low-rank factorization with a few landmarks in feature space. Moreover, the Reciprocal Neighbor Softmax achieves sparse attention to relevant -- rather than all -- neighbors only, which alleviates interference of irrelevant representations and further relieves the computational burden. In experiments on four large-scale datasets, NFormer achieves a new state-of-the-art. The code is released at \url{https://github.com/haochenheheda/NFormer}.

研究の動機と目的

  • オクルージョン、視点の変化、衣類の変化によって引き起こされる高次の同一アイデンティティの変動を解消すること。
  • 従来の手法がトレーニングバッチ内でのみ関係をモデル化するか、完全に画像間相互作用を無視するという限界を克服すること。
  • トレーニング時および推論時において、すべての入力画像間の関係を明示的にモデル化することで、ロバストな表現学習を可能にすること。
  • 全ペairワイズ類似度行列の近似を効率的に行い、関連する近隣のみに注目することで、大規模なRe-IDにおける計算コストを低減すること。
  • アーキテクチャの大幅な見直しを必要とせず、既存のRe-IDモデルを強化できるプラグアンドプレイモジュールの開発

提案手法

  • 特徴空間に少数のランドマークエージェントを用いて、全類似度行列を要因分解することで、計算量の二次的増加をランドマーク数に比例する線形に削減するLandmark Agent Attention (LAA) を導入する。
  • 相互に関連する近隣のみにスパースな注目を強制することで、無関係な表現からの干渉を最小限に抑えるReciprocal Neighbor Softmax (RNS) を採用する。
  • 低ランク要因分解を用いて強化された自己注意機構を用いて、すべての入力画像表現間のグローバル関係マップを構築する。
  • 関係モデリングと集約の後に、グローバル平均プーリングを適用して最終特徴を抽出する。
  • 特徴は、学習された類似度に基づいて隣接画像間を繰り返しメッセージ伝達することで精練される、二重ブランチアーキテクチャを採用する。
  • すべての画像間で完全な相互作用を実現し、トレーニング時と推論時の挙動のギャップを埋める、エンド・ツー・エンドのトレーニングと推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時および推論時に、すべての入力画像間の画像間関係をモデル化することで、person re-identificationにおけるロバスト性が向上するか?
  • RQ2全ペairワイズ類似度モデリングの計算コストを、表現品質を損なわずに低減できるか?
  • RQ3関連する近隣に限定したスパースな注目は、特徴の識別性を向上させ、ノイズを低減できるか?
  • RQ4提案手法は、同一アイデンティティあたりの画像枚数が異なる多様なRe-IDベンチマークに一般化できるか?
  • RQ5NFormerは、既存のSOTAモデルとどれほど統合可能で、性能をさらに向上させられるか?

主な発見

  • Market-1501では、ResNet-50と組み合わせたNFormerが94.7%のmAPと91.1%のトップ-1精度を達成し、新たなSOTAを樹立した。
  • DukeMTMC-reIDでは、ResNet-50を用いたNFormerが、2番目に良い手法であるISPに比べてmAPで3.5ポイント向上した。
  • MSMT17では、ResNet-50を用いたNFormerが83.5%のmAPを達成し、2番目に良い手法RGA-SCに比べて2.3ポイント優れた。
  • CUHK03では、ResNet-50を用いたNFormerが、手動ラベル付与セットでベースラインに比べてmAPが4.2%向上し、検出セットでは3.5%向上した。
  • ABDNetと組み合わせた場合、Market-1501では95.7%のmAPを達成し、2番目に良い手法をmAPで1.9ポイント、トップ-1精度で1.0ポイント上回った。
  • アブレーションスタディにより、NFormerの性能向上は、同一アイデンティティあたりの平均画像枚数が高いデータセットで顕著であることが確認され、より強いネイバー情報の活用が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。