Skip to main content
QUICK REVIEW

[論文レビュー] Im2Flow: Motion Hallucination from Static Images for Action Recognition

Ruohan Gao, Bo Xiong|arXiv (Cornell University)|Dec 12, 2017
Anomaly Detection Techniques and Applications参考文献 78被引用数 10
ひとこと要約

本論文では、ラベルなしの動画から学習した動きの事前分布を活用することで、単一の静止画像から光学的フローを想起(ホールーリング)する手法Im2Flowを提案する。深層エンコーダ・デコーダネットワークに新規のフロー符号化を組み合わせることで、現実的な動き予測を生成し、二重ストリームネットワークにおける外観特徴と融合させることで、UCF や Stanford-10 を含む7つのデータセットで最先端の性能を達成する。

ABSTRACT

Existing methods to recognize actions in static images take the images at their face value, learning the appearances---objects, scenes, and body poses---that distinguish each action class. However, such models are deprived of the rich dynamic structure and motions that also define human activity. We propose an approach that hallucinates the unobserved future motion implied by a single snapshot to help static-image action recognition. The key idea is to learn a prior over short-term dynamics from thousands of unlabeled videos, infer the anticipated optical flow on novel static images, and then train discriminative models that exploit both streams of information. Our main contributions are twofold. First, we devise an encoder-decoder convolutional neural network and a novel optical flow encoding that can translate a static image into an accurate flow map. Second, we show the power of hallucinated flow for recognition, successfully transferring the learned motion into a standard two-stream network for activity recognition. On seven datasets, we demonstrate the power of the approach. It not only achieves state-of-the-art accuracy for dense optical flow prediction, but also consistently enhances recognition of actions and dynamic scenes.

研究の動機と目的

  • 静止画像には明示的な動きの手がかりがないため、単一のスナップショットから妥当な将来の動きを推定することで、静止画像における行動認識の課題に取り組む。
  • 数千本のラベルなしの動画クリップから一般化された動きの事前分布を学習し、静止画像における動きの想起を支援する。
  • 元の画像からの外観特徴と、想起された光学的フローを補助的な動き信号として組み合わせることで、静止画像の行動認識を向上させる。
  • 訓練中に見られなかった行動に対しても、動きの想起が認識性能を向上させることを示す。

提案手法

  • 単一のRGB画像を密度のある光学的フロー地図に変換するように学習される畳み込みエンコーダ・デコーダネットワークを用い、短期間の動的変化をモデル化する。
  • 画像変換タスクにおける動きベクトルの表現を改善するために、新規の光学的フロー符号化方式を導入する。
  • 多様な人間や物体の動きを捉えるために、未加工でアノテーションのない動画クリップの大量なコレクションから動きの事前分布を学習する。
  • 想起されたフローを二重ストリームCNNアーキテクチャにおける元の画像の外観と融合させ、エンドツーエンドの行動認識を実現する。
  • 動きの事前分布学習には動画データを、静止画像認識ベンチマークでは微調整を用いて弱教師付きで学習する。
  • 新しいデータセット、特に新しい行動クラスを含むデータセットに適応させるために、転移学習を適用する。

実験結果

リサーチクエスチョン

  • RQ1動画データのみを教師信号として用いる場合に、深層ニューラルネットワークが単一の静止画像から妥当な将来の動きを推定できるか。
  • RQ2想起された動きが、静止画像の行動認識を向上させる補助信号としてどれほど有効か。
  • RQ3多様でラベルなしの動画から学習した動きの事前分布が、推論時に未確認の行動カテゴリに一般化できるか。
  • RQ4訓練用の動画にテスト画像の行動が含まれていなくても、想起されたフローが認識性能を向上させられるか。
  • RQ5認識タスクにおいて、想起されたフローの性能は、真値の光学的フローと比べてどの程度か。

主な発見

  • Im2Flowは、静止画像からの密度のある光学的フロー予測において最先端の性能を達成し、先行手法を顕著に上回る。
  • UCF101 データセットでは、BN-Inception を用いて 90.5% の精度を達成し、動画ベースの手法の最先端性能と同等である。
  • Stanford-10 データセットでは、二重ストリームネットワークに想起されたフローを追加することで、外観特徴のみのベースラインに比べて認識精度が最大 3.9 パcent 点向上した。
  • 訓練用の動画に含まれない新しい行動(例:フリスビーを投げる)に対しても、推定された動きにより有意義な性能向上が得られた。
  • 静止画像のYUP++ 動的シーン認識ベンチマークでは、外観特徴のみの場合は 74.3% であったが、推定された動きを用いることで 78.2% に向上し、自然な動的シーンへの一般化を示した。
  • データ拡張にのみ動画データを用いた先行手法に比べ、Stanford-10 では 74.9% の mAP を達成したのに対し、最も近いベースラインは 50.2% にとどまり、本手法が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。