Skip to main content
QUICK REVIEW

[論文レビュー] Action Completion: A Temporal Model for Moment Detection

Farnoosh Heidarivincheh, Majid Mirmehdi|arXiv (Cornell University)|May 17, 2018
Human Pose and Action Recognition参考文献 20被引用数 7
ひとこと要約

本論文は、完成タイミングのためのフレームレベルの投票を生成する、共同分類・回帰型再帰ニューラルネットワークを用いた新しい時系列モデルを提案する。再帰的投票機構により、完成前および完成後のフレームからの寄与を統合することで、3つのデータセットの16のアクションにおいて、1秒以内の完成瞬間検出で89%の正確性を達成する。

ABSTRACT

We introduce completion moment detection for actions - the problem of locating the moment of completion, when the action's goal is confidently considered achieved. The paper proposes a joint classification-regression recurrent model that predicts completion from a given frame, and then integrates frame-level contributions to detect sequence-level completion moment. We introduce a recurrent voting node that predicts the frame's relative position of the completion moment by either classification or regression. The method is also capable of detecting incompletion. For example, the method is capable of detecting a missed ball-catch, as well as the moment at which the ball is safely caught. We test the method on 16 actions from three public datasets, covering sports as well as daily actions. Results show that when combining contributions from frames prior to the completion moment as well as frames post completion, the completion moment is detected within one second in 89% of all tested sequences.

研究の動機と目的

  • 従来の手法がアクションの目的が達成されたかどうかを特定できないというアクション認識分野のギャップを埋める。
  • 従来のアクション開始・終了境界とは異なり、アクションの目的が確実に完了した瞬間を明確に定義し、検出する。
  • 失敗したアクション(例:ボールのミスキャッチ)や成功したアクション(例:ボールのキャッチ)の両方を検出できる堅牢なモデルを開発する。
  • スポーツおよび日常行動を含む多様なアクションにおいてモデルを評価し、分野を越えた一般化能力を示す。

提案手法

  • 動画フレームを処理し、完成タイミングのフレームレベル予測を生成する畳み込み-再帰ニューラルネットワーク(C-RNN)を提案する。
  • 完成瞬間の相対的位置を予測するために、分類出力と回帰出力を統合する再帰的投票ノードを導入する。
  • フレームが完成前、完成後、または完成に近い時期であるかを予測するための共同分類・回帰ヘッドを用いる。
  • フレームレベルの投票をシーケンス全体にわたって蓄積することで、最終的な完成瞬間を推定するシーケンスレベルの投票方式を採用する。
  • 4つの投票戦略(C-C:分類-分類、R-R:回帰-回帰、C-R:分類-回帰、R-C:回帰-分類)を採用し、C-Rが最も優れた性能を示した。
  • 訓練シーケンス内の真値の完成瞬間ラベルを用いて教師あり学習を実施する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、開始時や終了時ではなく、アクションの目的が達成された瞬間を正確に検出できるか?
  • RQ2完成前および完成後の段階からのフレームレベル予測を統合することで、完成瞬間検出の性能が向上するか?
  • RQ3提案された再帰的投票機構は、単独のフレームレベル分類または回帰と比べて優れているか?
  • RQ4モデルは、失敗したキャッチや成功したキャッチのような、完了した・しない両方のアクションを検出できるか?
  • RQ5本手法は、スポーツや日常行動を含む多様なアクションに対して一般化可能か?

主な発見

  • C-R投票戦略は、全テストシーケンスにおいて1秒以内の完成瞬間検出で89.9%の正確性を達成した。
  • 完全なシーケンス(全1,196件)ではC-R法が85.6%の正確性を達成したが、不完全なシーケンス(全362件)では96.1%の正確性に達した。
  • 本手法は完全なシーケンスでRD(相対的偏差)誤差を0.14に、不完全なシーケンスで0.04にまで低減し、他の投票戦略を上回った。
  • 完成前および完成後のフレームからのフレームレベル寄与が検出性能を顕著に向上させ、時間的文脈の価値を裏付けた。
  • モデルは、不完全なキャッチ(例:ミスキャッチ)のような失敗事例を高精度で検出でき、失敗ケースに対しても堅牢であることを示した。
  • HMDB、UCF101、RGBD-ACデータセットからの16の多様なアクションにおける結果から、本手法が分野およびアクションタイプを越えて一般化可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。