Skip to main content
QUICK REVIEW

[論文レビュー] Ordered or Orderless: A Revisit for Video based Person Re-Identification

Le Zhang, Zenglin Shi|arXiv (Cornell University)|Dec 24, 2019
Video Surveillance and Tracking Methods参考文献 55被引用数 6
ひとこと要約

この論文は、動画ベースの人物再識別(VPRe-id)における再帰的ネットワーク(RNN)の従来の使用法に挑戦し、時間的順序をモデル化しているにもかかわらず、しばしば順序に依存しない表現を生じることを主張する。代わりに、フレームレベルの特徴を用いて、画像ベースの再識別タスクのアンサンブルとしてVPRe-idを扱う手法を提案し、i.i.d.仮定の下で理論的誤差バウンドを導出し、iLIDS-VID、PRID 2011、MARSで最先端の性能を達成した。

ABSTRACT

Is recurrent network really necessary for learning a good visual representation for video based person re-identification (VPRe-id)? In this paper, we first show that the common practice of employing recurrent neural networks (RNNs) to aggregate temporal spatial features may not be optimal. Specifically, with a diagnostic analysis, we show that the recurrent structure may not be effective to learn temporal dependencies than what we expected and implicitly yields an orderless representation. Based on this observation, we then present a simple yet surprisingly powerful approach for VPRe-id, where we treat VPRe-id as an efficient orderless ensemble of image based person re-identification problem. More specifically, we divide videos into individual images and re-identify person with ensemble of image based rankers. Under the i.i.d. assumption, we provide an error bound that sheds light upon how could we improve VPRe-id. Our work also presents a promising way to bridge the gap between video and image based person re-identification. Comprehensive experimental evaluations demonstrate that the proposed solution achieves state-of-the-art performances on multiple widely used datasets (iLIDS-VID, PRID 2011, and MARS).

研究の動機と目的

  • 動画ベースの人物再識別(VPRe-id)において、再帰的ネットワーク(RNN)が本当に効果的な時間的表現を学習するために必要かどうかを調査すること。
  • VPRe-idにおけるRNNベースのモデルの内蔵的挙動を分析し、それが本当に意味のある時間的依存性を捉えているかどうかを評価すること。
  • 動画フレームを独立した画像として扱う、より単純で順序に依存しないアンサンブルアプローチを提案し、性能を向上させるとともに、画像再識別と動画再識別のギャップを埋めること。
  • i.i.d.仮定に基づく理論的誤差バウンドを用いて、提案手法を理論的に裏付けること。このバウンドは、フレーム数が増えると性能が指数関数的に向上することを示す。
  • 複雑なRNNアーキテクチャに依存せずに、複数の標準的VPRe-idベンチマークで最先端の性能を示すこと。

提案手法

  • 動画シーケンスを個々のフレームに分割し、各フレームに対して共通の画像ベースの人物再識別モデルを独立して適用する。
  • VPRe-idを、順序に依存しない画像ベースのランカーのアンサンブルとして定式化し、全フレームからの予測を投票または重み付き融合戦略を用いて統合する。
  • フレーム特徴がi.i.d.であると仮定することで、各ベースランカーがランダムより優れた性能を示す限り、誤差がフレーム数とともに指数関数的に減少する理論的バウンドを導出できる。
  • アンサンブルは、早期統合または後期統合の戦略を用いて実装され、異なる統合メカニズムにおける頑健性をアブレーションスタディで検証した。
  • フレーム数が多い場合のアンサンブル出力を近似するためにモンテカルロサンプリングを用い、計算効率を向上させた。
  • 標準指標(iLIDS-VID、PRID 2011、MARSデータセットにおけるCMC Rank-1とmAP)を用いて評価した。

実験結果

リサーチクエスチョン

  • RQ1VPRe-idにおけるRNNの使用は、本当に時間的モデリングを向上させるのか、それとも暗黙的に順序に依存しない表現を生じさせているのか?
  • RQ2単純な画像ベース再識別モデルのアンサンブルは、複雑なRNNベースの動画モデルを上回る性能を発揮できるか?
  • RQ3アンサンブルベースのVPRe-idシステムの性能が向上する条件は何か? また、その向上は理論的にバウンド可能か?
  • RQ4提案手法は、標準ベンチマークにおいて最先端のRNNベースおよびハイブリッドCNN-RNNアーキテクチャと比較してどのように差をつけるか?
  • RQ5フレーム選択と計算リソースの制約は、フレーム数とベースモデルの精度のトレードオフにどのような影響を与えるか?

主な発見

  • 提案されたアンサンブル手法は、iLIDS-VIDで最先端の性能を達成し、mAPが98.4%、CMC Rank-1が100.0%を記録した。
  • PRID 2011では、mAPが98.1%、CMC Rank-1が100.0%を達成し、先行するRNNベースの手法を上回った。
  • MARSでは、mAPが99.2%、CMC Rank-1が100.0%を達成し、比較したすべての最先端手法を上回った。
  • 理論的分析により、各ベースランカーの精度がランダムより高い限り、アンサンブルシステムの誤差がフレーム数とともに指数関数的に減少することが示された。
  • 診断的分析により、先行研究におけるRNNは意味のある時間的依存性をモデル化できず、むしろ順序に依存しない表現を生成していることが判明した。
  • 強い画像ベース再識別モデルを全フレームに適用することで、RNNを用いた複雑な時間的モデリングよりも優れた結果が得られることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。