Skip to main content
QUICK REVIEW

[論文レビュー] AMTnet: Action-Micro-Tube Regression by End-to-end Trainable Deep Architecture

Suman Saha, Gurkirt Singh|arXiv (Cornell University)|Apr 17, 2017
Human Pose and Action Recognition参考文献 35被引用数 9
ひとこと要約

AMTnetは、2つの連続フレームをカバーするアクション・マイクロ・チューブ(3次元動画候補)を、オプティカルフローに依存せず、RGBの外観情報のみを用いて回帰および分類する、エンド・ト・エンドで学習可能な3次元領域提案ネットワーク(3D-RPN)を提案する。空間的および時間的局所化を統合的に最適化することで、J-HMDB-21およびUCF-101で最先端の性能を達成し、学習済みの時間的リンクにより推論時間の計算量を50%削減する。

ABSTRACT

Dominant approaches to action detection can only provide sub-optimal solutions to the problem, as they rely on seeking frame-level detections, to later compose them into "action tubes" in a post-processing step. With this paper we radically depart from current practice, and take a first step towards the design and implementation of a deep network architecture able to classify and regress whole video subsets, so providing a truly optimal solution of the action detection problem. In this work, in particular, we propose a novel deep net framework able to regress and classify 3D region proposals spanning two successive video frames, whose core is an evolution of classical region proposal networks (RPNs). As such, our 3D-RPN net is able to effectively encode the temporal aspect of actions by purely exploiting appearance, as opposed to methods which heavily rely on expensive flow maps. The proposed model is end-to-end trainable and can be jointly optimised for action localisation and classification in a single step. At test time the network predicts "micro-tubes" encompassing two successive frames, which are linked up into complete action tubes via a new algorithm which exploits the temporal encoding learned by the network and cuts computation time by 50%. Promising results on the J-HMDB-21 and UCF-101 action detection datasets show that our model does outperform the state-of-the-art when relying purely on appearance.

研究の動機と目的

  • 現在のアクション検出フレームワークがフレームレベルの検出と後処理によるチューブ構築に依存するという非最適性に対処すること。
  • 2つの連続フレームをカバーする3次元動画領域候補(マイクロチューブ)を同時に回帰および分類できる深層学習アーキテクチャを設計すること。
  • オプティカルフローに依存せずに、アクション分類と3次元バウンディングボックス回帰を同時に最適化するエンド・ト・エンドの学習を可能にすること。
  • ヒューリスティックな後処理を学習済みの時間的リンクアルゴリズムに置き換え、ネットワークが時間的ダイナミクスをエンコードすることで、推論時の計算量を削減すること。
  • 時間的モデリングをネットワークアーキテクチャに直接統合することで、外観特徴(RGB)のみで、光流に基づく手法を上回る性能を達成できることを示すこと。

提案手法

  • ネットワークは、2つの並列なVGG-16バックボーンを用いて、連続する2つのRGBフレームを処理し、深層特徴を抽出する。
  • 融合された特徴マップに3D-RPNを適用し、関連するアクションネススコアを持つ3次元領域候補(マイクロチューブ)を生成する。
  • 提案サンプリングにより、IoUの閾値に基づいて正例および負例の3次元候補を選択し、アクションネスと回帰損失の両方を統合的に学習可能にする。
  • 二重特徴プーリングと要素ごとの特徴融合により、各3次元候補に対して固定サイズの表現を生成し、全結合層に渡して分類および回帰を実行する。
  • 推論時、訓練中に学習された時間的エンコーディングを用いて、予測されたマイクロチューブを新しいアクションチューブ生成器が結合し、計算量を50%削減する。
  • ネットワーク全体がエンド・ト・エンドで学習可能であり、1回の順伝播でアクション分類と3次元チューブ回帰の両方を最適化する。

実験結果

リサーチクエスチョン

  • RQ12つのフレームをカバーする3次元動画領域候補を同時に回帰および分類できる深層ネットワークは、後処理によるチューブ構築の必要を排除できるか?
  • RQ2RGB外観情報のみから直接時間的依存性を学習することで、オプティカルフローに依存する手法を上回ることができるか?
  • RQ3明示的な運動モデリングなしに、3次元RPNアーキテクチャが外観特徴のみで空間的・時間的ダイナミクスを効果的にエンコードできるか?
  • RQ4エンド・ト・エンドの3次元候補ネットワークの性能は、標準ベンチマークにおいて最先端の2段階フレームワークと比較してどうか?
  • RQ5学習済みの時間的リンク戦略により、推論時の計算量を削減しながら、検出精度を維持または向上できるか?

主な発見

  • AMTnetは、オプティカルフローを一切使用せず、RGB入力のみでJ-HMDB-21およびUCF-101の両データセットで最先端の性能を達成した。
  • J-HMDB-21における推論時間は1動画あたり8.5秒にまで短縮され、[8]、[38]、[26]を上回る速度性能を示した。
  • UCF-101における学習時間は4日間と短縮され、[8]および[38]と比較して2日間の削減を達成した。
  • モデルは、長時間にわたる未トリム動画(例:VolleyballSpikingはフレーム58から107まで)においても、正解チューブに近い精度でアクションを検出できた。
  • 動きのぼやけ、照明変化、クラス間の類似性(例:'stand' と 'sit')といった困難な条件下でも、良好な一般化性能を示した。
  • スケール変化や部分的隠蔽に対してもロバストであり、小さなまたは部分的に見えないアクションインスタンスを正確に検出できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。