Skip to main content
QUICK REVIEW

[論文レビュー] Collaborative Attention Network for Person Re-identification

Wenpeng Li, Yongli Sun|arXiv (Cornell University)|Nov 29, 2019
Video Surveillance and Tracking Methods参考文献 22被引用数 4
ひとこと要約

本論文では、マルチスケールのグローバル特徴から隣接する局所的特徴スライスを統合するエンド・ツー・エンドのアテンション機構を通じて特徴表現を向上させる協調的アテンションネットワーク(CAN)を提案する。隣接する局所領域間の空間的およびスケール関連の関係を保持することで、CANは市場1501でmAPで2.4%、rank-1で0.7%の向上を達成し、最先端の性能を実現した。

ABSTRACT

Jointly utilizing global and local features to improve model accuracy is becoming a popular approach for the person re-identification (ReID) problem, because previous works using global features alone have very limited capacity at extracting discriminative local patterns in the obtained feature representation. Existing works that attempt to collect local patterns either explicitly slice the global feature into several local pieces in a handcrafted way, or apply the attention mechanism to implicitly infer the importance of different local regions. In this paper, we show that by explicitly learning the importance of small local parts and part combinations, we can further improve the final feature representation for Re-ID. Specifically, we first separate the global feature into multiple local slices at different scale with a proposed multi-branch structure. Then we introduce the Collaborative Attention Network (CAN) to automatically learn the combination of features from adjacent slices. In this way, the combination keeps the intrinsic relation between adjacent features across local regions and scales, without losing information by partitioning the global features. Experiment results on several widely-used public datasets including Market-1501, DukeMTMC-ReID and CUHK03 prove that the proposed method outperforms many existing state-of-the-art methods.

研究の動機と目的

  • 人物再識別におけるグローバル特徴のみの制限を解決し、判別性の高い局所パターンを捉える。
  • 手作業による局所特徴スライス手法の情報損失と部分定義の任意性を克服する。
  • スケールをまたいだ隣接する局所領域間の関係をモデル化することで、部分ベースの特徴学習を向上させる。
  • グローバル特徴を分割せずに、動的かつ協調的な局所特徴に注目するエンド・ツー・エンドで学習可能なメカニズムを開発する。
  • マルチブランチアーキテクチャと共同最適化により、グローバル特徴と局所的に強化された表現を統合することで、ベンチマークデータセットで優れた性能を達成する。

提案手法

  • マルチブランチネットワーク構造を用いて、グローバル特徴マップを複数のマルチスケール局所スライスに分割する。
  • 隣接する局所スライスからの特徴を統合することで、空間的およびスケール関連の関係を保持する協調的アテンションネットワーク(CAN)を導入する。
  • 学習可能なアテンション重みを用いて、局所部分をまたがる情報量の多い隣接領域を動的に強調する。
  • トリプレット損失およびセンター損失にグローバルおよび局所ブランチを統合し、共同最適化により判別能力を向上させる。
  • 推論時における類似度測定に、特徴および重みの正規化とコサイン距離を適用する。
  • Adam最適化アルゴリズムを用い、コサインスケジュールによる学習率の減衰と、マルチ損失関数(CrossEntropy、Triplet、Center Loss)を用いてモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1固定された部分またはグローバル特徴のみに依存する手法を超えて、隣接する局所特徴スライスを統合することで、人物再識別における判別的表現が向上するか?
  • RQ2スケールおよび空間的近傍関係をまたがるスライス間の関係をモデル化することで、独立した局所特徴抽出よりも優れた性能が得られるか?
  • RQ3過学習や情報損失を引き起こさずに性能を最大化する最適な局所スライス数は何か?
  • RQ4エンド・ツー・エンドの協調的アテンション機構は、ハードアテンションや固定部分統合戦略を上回る性能を発揮できるか?
  • RQ5トリプレット損失およびセンター損失によるグローバルおよび局所ブランチの共同最適化は、標準ベンチマークで特徴の判別力を向上させるか?

主な発見

  • 提案されたCANは、Market-1501で90.6%のmAPおよび96.4%のrank-1を達成し、以前の最先端手法(Pyramid: 88.2% mAP、95.7% rank-1)をそれぞれ2.4ポイントおよび0.7ポイント上回った。
  • DukeMTMC-ReIDでは、CANは82.3%のmAPおよび91.6%のrank-1を達成し、以前の最良手法(Pyramid)を大きく上回った。
  • CUHK03では、CANは82.8%のmAPおよび86.1%のrank-1を達成し、ラベル付きおよび検出済み画像を用いてテストされたすべての先行研究を上回った。
  • 実験の結果、最適値を超えて局所スライス数を増やすと精度が低下することが示され、分解能と性能のトレードオフが存在することが明らかになった。
  • アブレーションスタディにより、隣接スライス間の協調的アテンションが、独立または固定部分統合よりも特徴表現をより効果的に向上させることを確認した。
  • トリプレット損失およびセンター損失によるグローバルおよび局所ブランチの共同最適化は、モデルの汎化能力および判別力の両方を顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。