Skip to main content
QUICK REVIEW

[論文レビュー] Action Recognition with Dynamic Image Networks

Hakan Bilen, Basura Fernando|arXiv (Cornell University)|Dec 2, 2016
Human Pose and Action Recognition参考文献 43被引用数 12
ひとこと要約

本論文では、ランクプーリングを用いて外観と時間的ダイナミクスの両方を符号化する、コンactな動画像表現「ダイナミック画像」を導入する。動画シーケンスを1枚の画像に変換することで、事前学習済みのCNNを動画認識に直接適用可能にし、ResNeXt-101を用いた4ストリームアーキテクチャにより、UCF101およびHMDB51ベンチマークで最先端の性能を達成する。

ABSTRACT

We introduce the concept of "dynamic image", a novel compact representation of videos useful for video analysis, particularly in combination with convolutional neural networks (CNNs). A dynamic image encodes temporal data such as RGB or optical flow videos by using the concept of `rank pooling'. The idea is to learn a ranking machine that captures the temporal evolution of the data and to use the parameters of the latter as a representation. When a linear ranking machine is used, the resulting representation is in the form of an image, which we call dynamic because it summarizes the video dynamics in addition of appearance. This is a powerful idea because it allows to convert any video to an image so that existing CNN models pre-trained for the analysis of still images can be immediately extended to videos. We also present an efficient and effective approximate rank pooling operator, accelerating standard rank pooling algorithms by orders of magnitude, and formulate that as a CNN layer. This new layer allows generalizing dynamic images to dynamic feature maps. We demonstrate the power of the new representations on standard benchmarks in action recognition achieving state-of-the-art performance.

研究の動機と目的

  • 長期間にわたる運動と外観を効率的なディープラーニングに適した、コンパクトでコンテンツに依存しない動画表現を開発すること。
  • 動画をダイナミック画像に変換することで、静止画用に事前学習されたCNNを直接動画処理に応用可能にする。
  • 新しい近似ランクプールリング層を用いて、逐次処理の代わりに単一画像推論に置き換えることで、動画分析を高速化すること。
  • 光流や軌道記述子のような手作業特徴量に依存せずに、アクション認識の精度を向上させること。

提案手法

  • ランクプールリングを用いて動画フレームの順序付けを行うランクマシンを学習することで、動画のダイナミック画像表現を提案する。
  • ピクセルレベルおよびCNN特徴マップ内でのランクプールリングを適用し、ダイナミック画像およびダイナミック特徴マップを生成する。
  • バックプロパゲーションが可能となる微分可能なCNN層として、標準ランクプールリングの近似版である近似ランクプールリング演算子を導入する。
  • RGBおよび光流入力を用いた静的およびダイナミック表現を統合する4ストリームCNNアーキテクチャを設計する。
  • ResNeXtのような深層ネットワークにダイナミック画像を入力とすることで、エンドツーエンドの動画アクション認識を実現する。
  • 標準ランクプールリングの効率的で微分可能な近似を採用し、計算を数個のオーダーで高速化する。

実験結果

リサーチクエスチョン

  • RQ1外観と時間的ダイナミクスを保持する、コンパクトで画像に類似した動画表現を学習可能か?
  • RQ2ランクプールリングをディープラーニングパイプラインで効率的かつ微分可能にするにはどうすればよいか?
  • RQ3光流や改良型密軌道(iDT)のような手作業特徴量に依存せずに、ダイナミック画像が最先端の手法を上回るか、同等の性能を発揮できるか?
  • RQ4RGBおよび光流から得られる静的およびダイナミック表現の統合が、アクション認識の精度をどの程度向上させるか?
  • RQ5ダイナミック画像表現を生ピクセルに限らず、中間のCNN特徴マップへ一般化できるか?

主な発見

  • 提案された4ストリームネットワークにダイナミック画像を用いることで、ResNeXt-101を用いてHMDB51で96.0%の平均精度、UCF101で95.5%の精度を達成し、先行研究を上回った。
  • 光流や手作業特徴量を一切使用しない状態でも、UCF101で90.6%の精度を達成し、多くの競合手法を上回った。
  • 改良型密軌道(iDT)の導入は性能向上に僅かに寄与するにとどまり(UCF101で95.5% → 96.0%)、主な向上はダイナミック画像表現自体に起因していることが示された。
  • 近似ランクプールリング層は、標準ランクプールリングの計算を数個のオーダーで高速化しながら、性能を維持し、バックプロパゲーションを可能にした。
  • UCF101およびHMDB51の両ベンチマークで最先端の結果を達成した。これは、ダイナミック画像が強力で効率的な動画表現であることを示している。
  • ダイナミック画像表現により、ResNeXtのような非常に深層なネットワークとのエンドツーエンド学習が可能となり、現代のCNNアーキテクチャと強い互換性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。