Skip to main content
QUICK REVIEW

[論文レビュー] Motion Feature Network: Fixed Motion Filter for Action Recognition

Myunggi Lee, Seungeui Lee|arXiv (Cornell University)|Jul 26, 2018
Human Pose and Action Recognition参考文献 24被引用数 4
ひとこと要約

本稿では、固定方向フィルタを用いてRGBフレームから直接空間時間特徴を符号化する学習可能なモーショングラフブロックを備えた統合的2次元CNNアーキテクチャ、MFNetを提案する。光学フローまたは3次元畳み込みを必要とせず、事前学習やマルチストリーム統合なしで、スクラッチから訓練することで、Jester(96.22%top-1精度)およびSomething-Something(37.48%top-1精度)で最先端の性能を達成した。

ABSTRACT

Spatio-temporal representations in frame sequences play an important role in the task of action recognition. Previously, a method of using optical flow as a temporal information in combination with a set of RGB images that contain spatial information has shown great performance enhancement in the action recognition tasks. However, it has an expensive computational cost and requires two-stream (RGB and optical flow) framework. In this paper, we propose MFNet (Motion Feature Network) containing motion blocks which make it possible to encode spatio-temporal information between adjacent frames in a unified network that can be trained end-to-end. The motion block can be attached to any existing CNN-based action recognition frameworks with only a small additional cost. We evaluated our network on two of the action recognition datasets (Jester and Something-Something) and achieved competitive performances for both datasets by training the networks from scratch.

研究の動機と目的

  • 行動認識における2ストリーム法および3次元CNN手法の高い計算コストと複雑さに対処すること。
  • 光学フローを事前計算せず、RGB入力のみでエンドツーエンドの空間時間特徴の学習を可能にすること。
  • 既存の2次元CNNフレームワークに最小限のオーバーヘッドで統合可能な軽量でモジュラーなモーションブロックを設計すること。
  • 空間的ヒントだけでは不十分な、微細で時間的に対称な行動に対して性能を向上させること。
  • 追加のモダリティ監視なしに、モーションブロックが動きの方向と時間的ダイナミクスを効果的に捉えられることを検証すること。

提案手法

  • 連続するRGBフレームの特徴マップに固定方向フィルタ(例:水平、垂直、対角線)を適用するモーションブロックを導入する。
  • 元の特徴マップからシフトされた特徴マップを差し引くことでモーション特徴を計算し、パラメータを学習しないが光学フローに類似した動作を実現する。
  • ResNetなどの2次元CNNバックボーンにモーションブロックをプラグインモジュールとして統合し、エンドツーエンドの学習を可能にする。
  • RGB入力のみを用いた2ストリームに類似した推論戦略を採用するが、セグメントごとの特徴集約を実施する。
  • 空間特徴のための共有特徴抽出器と時間的モデリングのための別個のモーションブロックを用い、両者を同時に学習する。
  • セグメントごとに時間的平均プーリングを適用して特徴を集約し、構造的変更を最小限に抑えて分類を可能にする。

実験結果

リサーチクエスチョン

  • RQ1固定で学習しないモーションフィルタは、動画行動認識において空間時間的ダイナミクスを効果的に捉えられるか?
  • RQ2スクラッチからRGB入力のみで学習する統合的2次元CNNにモーションブロックを組み込むことで、2ストリームまたは3次元CNNベースラインを上回る性能が得られるか?
  • RQ3本稿で提案するモーションブロックは、『左にスワイプ』対『右にスワイプ』のような時間的に対称な行動ペアの分類精度をどのように向上させるか?
  • RQ4推論における最適なセグメント数は何か?また、これは学習時に使用された数とどのように関係するか?
  • RQ5大規模データセットでの事前学習なしに、モーションブロックが異なる行動認識データセットに効果的に転送または一般化可能か?

主な発見

  • MFNetはJesterテストセットで96.22%のtop-1精度を達成し、光学フローもImageNetの事前学習重みも使用しない既存手法を上回った。
  • Something-Somethingデータセットでは、公式リーダーボードで37.48%のtop-1精度を達成し、微細な行動認識において強力な性能を示した。
  • 時間的に対称な行動ペアの誤分類が顕著に減少した—例として、「手を前に転がす」の予測が「手を後ろに転がす」と誤分類される割合は、ベースラインの35.7%からMFNetでは4.2%にまで低下した。
  • 検証用セグメント数を増やすことで性能が向上し、K=7でピークに達したが、学習時のKよりわずかに高い最適値を示しており、より細かい時間サンプリングの利点が示された。
  • アブレーションスタディにより、特に動きの方向を区別する能力向上に、モーションブロックが顕著に寄与することが確認された。これは、事前学習やマルチスケール統合なしでも同様に有効であることを示している。
  • 2次元CNNの基盤と固定フィルタのおかげで、3次元ConvNetや2ストリームモデルと比較してパラメータ数が少なく、計算コストも低く抑えられ、競争力のある結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。