Skip to main content
QUICK REVIEW

[論文レビュー] DAP3D-Net: Where, What and How Actions Occur in Videos?

Li Liu, Yi Zhou|arXiv (Cornell University)|Feb 10, 2016
Human Pose and Action Recognition参考文献 56被引用数 6
ひとこと要約

本論文では、動画におけるアクションの局所化、分類、階層的運動属性学習を統合的に行うマルチタスク3次元畳み込みニューラルネットワーク、DAP3D-Netを提案する。新しい大規模な合成データセット(NASA)を用いて外見とオプティカルフローの入力を活用し、実世界のデータセット(HAU)で評価することで、アクション検出および属性予測において最先端の性能を達成した。局所化精度は3.4%〜5.3%向上し、属性学習では最大34.2%のAUC向上を達成した。

ABSTRACT

Action parsing in videos with complex scenes is an interesting but challenging task in computer vision. In this paper, we propose a generic 3D convolutional neural network in a multi-task learning manner for effective Deep Action Parsing (DAP3D-Net) in videos. Particularly, in the training phase, action localization, classification and attributes learning can be jointly optimized on our appearancemotion data via DAP3D-Net. For an upcoming test video, we can describe each individual action in the video simultaneously as: Where the action occurs, What the action is and How the action is performed. To well demonstrate the effectiveness of the proposed DAP3D-Net, we also contribute a new Numerous-category Aligned Synthetic Action dataset, i.e., NASA, which consists of 200; 000 action clips of more than 300 categories and with 33 pre-defined action attributes in two hierarchical levels (i.e., low-level attributes of basic body part movements and high-level attributes related to action motion). We learn DAP3D-Net using the NASA dataset and then evaluate it on our collected Human Action Understanding (HAU) dataset. Experimental results show that our approach can accurately localize, categorize and describe multiple actions in realistic videos.

研究の動機と目的

  • 複雑な動画行動解析の課題に、アクションの局所化、分類、運動属性学習を統合的に解決することで対処すること。
  • 局所化、分類、属性記述の間の相関関係をモデル化する統一されたディープラーニングフレームワークを構築すること。
  • 200,000本以上のクリップを含み、300種類以上のカテゴリと33種類の階層的属性を持つ、大規模かつ高品質にアノテーションされた合成データセット(NASA)を構築すること。
  • 実際の人体行動理解データセット(HAU)上でモデルを評価し、真の局所位置、カテゴリ、属性を備えること。
  • 3次元畳み込みニューラルネットワークを用いたマルチタスク学習が、単一タスクまたは独立学習アプローチよりも性能を向上させることを示すこと。

提案手法

  • DAP3D-Netは、空間的・時間的モデリングのため、外見(RGB)と運動(オプティカルフロー)特徴を入力とする3次元畳み込みニューラルネットワークアーキテクチャを採用する。
  • モデルは、アクション局所化(ボクシングボックス回帰)、アクション分類(ソフトマックス)、階層的属性予測(H1: 低レベルの身体部の動き;H2: 高レベルの運動パターン)の3つのヘッドを同時に最適化することでマルチタスク学習を実現する。
  • 2段階の階層的属性学習スキームを採用し、低レベルと高レベルの属性を異なる全結合層(FC1 と FC2)から予測することで表現学習を向上させる。
  • 分類、局所化、属性予測の損失を統合したジョイント損失関数を用いて、エンドツーエンドでネットワークを訓練する。
  • 事前学習済みのC3Dモデルからの特徴を用いて、HAUデータセット上で微調整することで、トランスファー学習を適用する。
  • 後処理として、ボクシングボックスリグレッサー(BBR)によるボクシングボックスの最適化と、比較のための抽出特徴量上のオプションのSVM分類を実施する。

実験結果

リサーチクエスチョン

  • RQ1統一されたディープラーニングフレームワークは、複雑な動画シーンにおけるアクション局所化、分類、運動属性学習という3つの密接に関連する問題を効果的に解決できるか?
  • RQ23次元畳み込みニューラルネットワークアーキテクチャにおけるジョイントマルチタスク学習は、単一タスクまたは独立学習と比較して、行動解析性能においてどのように差をつけるか?
  • RQ3外見情報のみと比較して、オプティカルフローを運動入力として使用することで、アクション局所化および属性予測の性能がどの程度向上するか?
  • RQ4提案された階層的属性学習スキーム(H1 と H2)は、すべての属性を1つの層から学習する方法と比較して、どの程度優れているか?
  • RQ5モデルは実世界の動画に一般化可能であり、アクション検出および属性予測において最先端の手法を上回る性能を示せるか?

主な発見

  • 微調整を施したDAP3D-Net(DAP3D-Net 2 + Ft)は、ソフトマックス分類器を用いた場合、HAUデータセットでmAP 70.6%を達成し、線形SVMを用いたベースラインを上回った。
  • ボクシングボックスリグレッサー(BBR)の導入により、BBRなしのDAP3D-Netと比較して、アクション検出のmAPが3.4%〜5.3%向上した。
  • DAP3D-Net 2 + Ftは、低レベル属性(H1)で32.5%、高レベル属性(H2)で34.2%のAUC向上を、ベースライン手法と比較して達成した。
  • FC1とFC2からそれぞれH1とH2を予測する階層的属性学習スキームは、すべての33属性を1つの層(例:FC2)から学習する方法よりも優れており、より高いAUCとヒットレート(H1: 17/19、H2: 12/14)を達成した。
  • DAP3D-Net 2 から抽出した特徴量に線形SVMを適用すると、ソフトマックス分類器と比較してmAPが1%向上したが、1本の600フレーム動画あたりの合計検出時間が158.67秒にまで延び、エンドツーエンドのソフトマックスアプローチがより効率的であることが示された。
  • 定性的な結果(図8)から、モデルは正確なボクシングボックスを用いてアクションを局所化し、同時にアクションカテゴリと運動属性を予測できていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。