Skip to main content
QUICK REVIEW

[論文レビュー] Video-based Person Re-identification with Accumulative Motion Context

Hao Liu, Zequn Jie|arXiv (Cornell University)|Jan 1, 2017
Video Surveillance and Tracking Methods参考文献 26被引用数 13
ひとこと要約

本稿では、動画シーケンスから外見特徴と動き特徴を同時に学習する、2ストリームのエンドツーエンドディープラーニングフレームワーク、累積的動きコンテキスト(AMOC)ネットワークを提案する。再帰的集積を用いてフレーム間で動きコンテキストを蓄積することで、iLIDS-VID、PRID-2011、MARSの各データセットで最先端の性能を達成し、MARSでは68.3%のランク-1正答率と52.9%のmAPを達成。従来手法よりも最大3%のランク-1正答率向上を実現した。

ABSTRACT

Video based person re-identification plays a central role in realistic security and video surveillance. In this paper we propose a novel Accumulative Motion Context (AMOC) network for addressing this important problem, which effectively exploits the long-range motion context for robustly identifying the same person under challenging conditions. Given a video sequence of the same or different persons, the proposed AMOC network jointly learns appearance representation and motion context from a collection of adjacent frames using a two-stream convolutional architecture. Then AMOC accumulates clues from motion context by recurrent aggregation, allowing effective information flow among adjacent frames and capturing dynamic gist of the persons. The architecture of AMOC is end-to-end trainable and thus motion context can be adapted to complement appearance clues under unfavorable conditions (e.g. occlusions). Extensive experiments are conduced on three public benchmark datasets, i.e., the iLIDS-VID, PRID-2011 and MARS datasets, to investigate the performance of AMOC. The experimental results demonstrate that the proposed AMOC network outperforms state-of-the-arts for video-based re-identification significantly and confirm the advantage of exploiting long-range motion context for video based person re-identification, validating our motivation evidently.

研究の動機と目的

  • 動画監視における照明、ポーズ、視点、背景のごみの影響による顕著な外見変動に起因する人物再識別の課題に対処すること。
  • 単一フレームの外見特徴を超えた長距離の動きコンテキストを活用することで、識別性能のロバスト性を向上させること。
  • 再帰的動きの蓄積を用いて、外見と動き表現を同時に学習するエンドツーエンドで訓練可能なアーキテクチャを開発すること。
  • 手作業で作成したオプティカルフローと単一ストリームのCNNの限界を克服し、再識別パイプラインに直接動き学習を統合すること。
  • 時間的に蓄積された動きコンテキストが、人物再識別における判別的特徴学習を強化することを示すこと。

提案手法

  • AMOCネットワークは、外見特徴を処理するRGBフレーム用ストリームと、動きコンテキストを処理するオプティカルフロー用ストリームを備えた2ストリームの畳み込みアーキテクチャを採用する。
  • オプティカルフローは、再識別ネットワークと同時に訓練されるフローネットを用いてエンドツーエンドで推定され、事前に抽出されたフローに依存しない。
  • 動きコンテキストは、隣接フレーム間の動き特徴を集約することで長距離時系列ダイナミクスをモデル化する再帰的ニューラルネットワーク(RNN)モジュールによって蓄積される。
  • 外見特徴と動き特徴は特徴レベルで統合され、判別力の向上を図るためにエンドツーエンド訓練で同時に最適化される。
  • 特徴抽出やメトリクス学習のステージを別々に設けず、動画シーケンス上でエンドツーエンドで訓練されることで、特徴とマッチング基準の共同最適化が可能になる。
  • トレーニング中にEpicFlowを用いることで、事前処理を要せず高品質な動き監視が得られる。

実験結果

リサーチクエスチョン

  • RQ1厳しい視覚的条件下での動画シーケンスにおいて、長距離の動きコンテキストが人物再識別性能を顕著に向上させ得るか?
  • RQ2再帰的動き蓄積を用いた外見と動き特徴のエンドツーエンド学習は、分離された特徴抽出とメトリクス学習に比べてより優れた一般化性能を示すか?
  • RQ3手作業で作成した記述子や事前に抽出されたオプティカルフローに依存する最先端手法と比較して、提案されたAMOCネットワークはどのように差をつけるか?
  • RQ4動きコンテキストの統合は、クロスカメラ再識別におけるオクルージョンや外見変動の影響をどの程度軽減するか?
  • RQ5分離された特徴抽出とメトリクス学習を分離する手法と比較して、共同で訓練可能なエンドツーエンドアーキテクチャは性能を上回るか?

主な発見

  • MARSデータセットでは、AMOCモデルが68.3%のランク-1正答率を達成し、以前の最先端手法(IDE + XQDA)を3ポイント上回った。
  • MARSでは、AMOCモデルが52.9%の平均平均精度(mAP)を達成し、最良のベースライン(IDE + XQDA)の47.6% mAPを上回った。
  • iLIDS-VIDおよびPRID-2011でも、AMOCモデルは競争力のある性能を示し、多様なベンチマークデータセットにおけるロバスト性を確認した。
  • ImageNetの事前学習なしでスクラッチから訓練されたにもかかわらず、手作業で作成した記述子(例:LOMO、BoW)やメトリクス学習(例:XQDA、KISSME)を用いる手法よりも顕著な性能向上を達成した。
  • アブレーションスタディにより、再帰的動き蓄積が性能を顕著に向上させることを確認し、長距離の動きコンテキストの価値を示した。
  • オプティカルフロー地図の可視化から、動きネットワークがフォアグラウンドの動きを効果的に捉えていることが示されたが、背景の動きはまだノイズを引き起こす可能性があるため、セグメンテーション統合による改善の余地がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。