Skip to main content
QUICK REVIEW

[論文レビュー] Deep Feature Flow for Video Recognition

Xizhou Zhu, Yuwen Xiong|arXiv (Cornell University)|Nov 23, 2016
Advanced Neural Network Applications参考文献 11被引用数 9
ひとこと要約

この論文では、深層畳み込みネットワークを疎なキーフレームでのみ適用し、学習されたオプティカルフロー場を用いてその深層特徴を隣接フレームに伝搬する、高速かつ高精度な動画認識フレームワークであるDeep Feature Flowを提案する。認識ネットワークとフローネットワークをエンド・ツー・エンドで訓練することで、1フレームごとの推論に比べて最大10倍の高速化を達成しつつ、わずかな精度損失に抑え、リアルタイム動画認識の分野を顕著に前進させる。

ABSTRACT

Deep convolutional neutral networks have achieved great success on image recognition tasks. Yet, it is non-trivial to transfer the state-of-the-art image recognition networks to videos as per-frame evaluation is too slow and unaffordable. We present deep feature flow, a fast and accurate framework for video recognition. It runs the expensive convolutional sub-network only on sparse key frames and propagates their deep feature maps to other frames via a flow field. It achieves significant speedup as flow computation is relatively fast. The end-to-end training of the whole architecture significantly boosts the recognition accuracy. Deep feature flow is flexible and general. It is validated on two recent large scale video datasets. It makes a large step towards practical video recognition.

研究の動機と目的

  • 最新の画像認識ネットワークを動画のすべてのフレームに適用する際の高い計算コストを低減すること。
  • 動画内の時間的連続性を活用し、オプティカルフローを用いてフレーム間で深層特徴を伝搬すること。
  • 認識ネットワークとフローネットワークをエンド・ツー・エンドで共同訓練することで、精度と効率の両方を向上させること。
  • 自動運転や監視など、リアルタイム動画応用分野における強力な画像認識モデルの実用的導入を可能にすること。

提案手法

  • フレームワークは、計算負荷を低減するため、疎なキーフレームでのみ深層畳み込みネットワークを実行する。
  • キーフレームからの中間特徴マップを、オプティカルフローの類似ワープ処理により隣接フレームに伝搬する。
  • フローフィールドは、認識ネットワークとエンド・ツー・エンドで訓練される専用のフローネットワーク(例:FlowNet)によって推定される。
  • 特徴伝搬後に認識ヘッドを適用することで、タスク固有の特徴の微調整が可能になる。
  • 全体のアーキテクチャはエンド・ツー・エンドで訓練され、認識精度とフローフィールド推定の両方を最適化する。
  • 最終タスクヘッドを変更することで、画像セマンティックセグメンテーションやオブジェクト検出を含む、さまざまな動画認識タスクに対応可能である。

実験結果

リサーチクエスチョン

  • RQ1オプティカルフローを用いてキーフレームからの深層特徴を隣接フレームに効果的に伝搬させることで、動画認識における計算負荷を低減できるか?
  • RQ2認識ネットワークとフローネットワークをエンド・ツー・エンドで共同訓練することで、別々に訓練する場合と比較して認識精度が向上するか?
  • RQ3特徴伝搬によってどれほど推論時間を短縮できるか、かつ高い認識性能を維持できるか?
  • RQ4キーフレーム間隔やネットワークアーキテクチャの選定が、速度と精度のトレードオフにどのように影響するか?

主な発見

  • 本手法は、1フレームごとの推論に比べて最大10倍の高速化を達成しつつ、動画データセット上で競争力のある認識精度を維持した。
  • エンド・ツー・エンドでの訓練により認識精度が顕著に向上し、フローや認識の共同最適化の利点が明確に示された。
  • フレームワークは柔軟かつ汎用的であり、Cityscapesでの動画セマンティックセグメンテーションおよびImageNet VIDでのオブジェクト検出に成功して適用された。
  • 特徴伝搬後に1層のタスクヘッドを使用しても、12層のヘッドとほぼ同等の性能を示し、伝搬された特徴が極めて代表的であることが示された。
  • 中程度のキーフレーム間隔でも高い性能を維持でき、リアルタイム推論が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。