Skip to main content
QUICK REVIEW

[論文レビュー] View Confusion Feature Learning for Person Re-identification

Fangyi Liu, Lei Zhang|arXiv (Cornell University)|Oct 9, 2019
Video Surveillance and Tracking Methods参考文献 34被引用数 13
ひとこと要約

本稿では、視覚的変化に強い特徴を学習するためのエンドツーエンドのディーブラーニングフレームワークであるビュー・コンフュージョン・フェイチャーラーニング(VCFL)を提案する。VCFLは、特徴抽出器とビュー分類器の対抗的トレーニング、特徴中心に基づくコンフュージョン、SIFTを用いたガイドラインによる監視を通じて、ビュー不変特徴を学習する。VCFLは、CUHK01、CUHK03、MARKET1501で最先端の性能を達成し、それぞれmAPが90.94%、93.97%、74.48%を記録し、ビュー変化に対して優れた耐性を示している。

ABSTRACT

Person re-identification is an important task in video surveillance that aims to associate people across camera views at different locations and time. View variability is always a challenging problem seriously degrading person re-identification performance. Most of the existing methods either focus on how to learn view invariant feature or how to combine view-wise features. In this paper, we mainly focus on how to learn view-invariant features by getting rid of view specific information through a view confusion learning mechanism. Specifically, we propose an end-toend trainable framework, called View Confusion Feature Learning (VCFL), for person Re-ID across cameras. To the best of our knowledge, VCFL is originally proposed to learn view-invariant identity-wise features, and it is a kind of combination of view-generic and view-specific methods. Classifiers and feature centers are utilized to achieve view confusion. Furthermore, we extract sift-guided features by using bag-of-words model to help supervise the training of deep networks and enhance the view invariance of features. In experiments, our approach is validated on three benchmark datasets including CUHK01, CUHK03, and MARKET1501, which show the superiority of the proposed method over several state-of-the-art approaches

研究の動機と目的

  • カメラのアングルやポーズの違いによって性能が低下する、人物再識別におけるビュー変動の課題に対処すること。
  • 深層特徴からビュー固有の情報を除去することで、アイデンティティ固有の特徴を、ビュー変化に対して不変に学習すること。
  • ビュー一般的なモデルとビュー特化的なモデルの長所を統合した統一フレームワークを構築し、特徴の耐性を高めること。
  • トレーニング中にSIFT特徴をバケット・オブ・ワードモデルを介して統合することで、深層特徴の品質を向上させること。
  • 複数の補完的メカニズムを統合した統一損失関数を設計し、ビューのコンフュージョンを強制すること。

提案手法

  • ビュー不変特徴を促進するために、特徴抽出器と対抗的にトレーニングされるビュー分類器を導入し、特徴抽出器がカメラの視点を特定できないようにするビュー・コンフュージョン機構を提案する。
  • 同じアイデンティティの異なるビュー間の特徴とそれらに対応するクラス中心との距離を最小化することで、特徴ベースのコンフュージョンを実現する。
  • スケール不変特徴変換(SIFT)を用いて特徴を抽出し、バケット・オブ・ワード表現に変換し、SIFTガイドライン損失を通じて深層ネットワークを監視する。
  • 全体の損失関数は、トリプルット損失、ビュー分類器のコンフュージョン損失、特徴中心のコンフュージョン損失、SIFTガイドライン損失を組み合わせ、適応的重み付けにより寄与をバランスさせる。
  • 特徴抽出器とビュー分類器を交互に更新する対抗的トレーニング戦略を用いて、エンドツーエンドでフレームワークをトレーニングする。
  • 本手法は、ResNet-50およびGoogLeNetベースのバックボーンを用いて、3つのベンチマークデータセット(CUHK01、CUHK03、MARKET1501)で評価された。

実験結果

リサーチクエスチョン

  • RQ1特徴抽出器とビュー分類器の間で対抗的トレーニングを実施することで、人物再識別におけるビュー固有バイアスを効果的に低減できるか?
  • RQ2アイデンティティ固有の中心への特徴の近接性を強制することで、視点間の一般化性能がどの程度向上するか?
  • RQ3バケット・オブ・ワードモデルを介してSIFT特徴を統合することで、深層特徴のビュー不変性がどのように向上するか?
  • RQ4各コンponent(分類器ベース、特徴ベース、SIFTベース)の相対的寄与度は、全体の性能向上にどの程度寄与しているか?
  • RQ5ビュー一般的な学習戦略とビュー特化的な学習戦略を統合した統一フレームワークは、標準ベンチマークで既存の最先端手法を上回ることができるか?

主な発見

  • MARKET1501データセットにおいて、VCFLはトップ1正答率89.25%および平均平均精度(mAP)74.48%を達成し、ベースラインおよび他の最先端手法を上回った。
  • SIFTガイドラインコンポーネントは、MARKET1501におけるベースラインからmAPを3.37ポイント向上させ、顕著な寄与を示した。
  • 特徴ベースのコンフュージョン損失のみを適用しても、MARKET1501でmAPが2.29ポイント向上し、視点間の特徴分散低減の有効性が裏付けられた。
  • ビュー分類器ベースのコンフュージョンは、対抗的トレーニングの影響でやや不安定であるが、適切な重み付けがなされれば顕著な寄与を示し、ビュー不変性の促進役を果たしていることが示された。
  • アブレーションスタディの結果、ビュー・コンフュージョン機構の各コンponentが正の寄与を示し、全コンポーネントの組み合わせが全データセットで最高の性能を達成した。
  • CUHK01およびCUHK03でも一貫した向上が得られ、それぞれmAPが90.94%および93.97%を記録し、多様なデータセットにわたる耐性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。