Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Human Activities Using Stochastic Grammar

Siyuan Qi, Siyuan Huang|arXiv (Cornell University)|Aug 2, 2017
Human Pose and Action Recognition参考文献 2被引用数 3
ひとこと要約

本稿では、部分的に観測されたRGB-D動画から将来の人的行動を予測するため、空間的・時間的かつ論理的構造を持つ文法(ST-AOG)を用いた確率的文法モデルを提案する。時間的確率的文法とイアリー解析を統合し、人間の行動、物体、および物体の機能的特性(アフォーダンス)を統合的に扱い、将来の部分的行動とそのラベルを推論する。ベンチマークデータセットにおいて、意味的イベント解析および将来行動予測の分野で最先端の性能を達成した。

ABSTRACT

This paper presents a novel method to predict future human activities from partially observed RGB-D videos. Human activity prediction is generally difficult due to its non-Markovian property and the rich context between human and environments. We use a stochastic grammar model to capture the compositional structure of events, integrating human actions, objects, and their affordances. We represent the event by a spatial-temporal And-Or graph (ST-AOG). The ST-AOG is composed of a temporal stochastic grammar defined on sub-activities, and spatial graphs representing sub-activities that consist of human actions, objects, and their affordances. Future sub-activities are predicted using the temporal grammar and Earley parsing algorithm. The corresponding action, object, and affordance labels are then inferred accordingly. Extensive experiments are conducted to show the effectiveness of our model on both semantic event parsing and future activity prediction.

研究の動機と目的

  • マルコフ的仮定を超えた人的行動の階層的かつ構成的構造をモデル化すること。
  • 部分的な動画観測からの現在の行動状態のオンライン推論および将来の行動予測を可能にすること。
  • 人的行動、相互作用する物体、および物体のアフォーダンスを統合的にモデル化し、より豊かな空間的・時間的文脈を捉えること。
  • 大きな将来状態空間からの予測に、記号的推論と確率的文法を用いて挑戦に応えること。

提案手法

  • 人的行動を空間的・時間的論理的構造グラフ(ST-AOG)として表現し、時間的確率的文法(T-AOG)と空間的グラフ(S-AOG)を統合して部分的行動をモデル化する。
  • 部分的行動を確率的文脈自由文法の非終端記号としてモデル化し、終端記号は行動-物体-アフォーダンスの三つ組みとして定義する。
  • イアリー解析アルゴリズムを用いて、現在の観測と文法規則に基づき、次に予測される部分的行動を記号的に推定する。
  • 予測されたシーケンスの確率を推定するために、ビタビ方式の推論を用いて解析の尤度を計算する。
  • 解析された部分的行動の予測結果と学習済み特徴表現を統合し、行動、物体、アフォーダンスのラベルを推論する。
  • トレーニング中に同値クラスをブートストラップする際、カバレッジ閾値を0.5、コンテキストウィンドウサイズを4として設定する。

実験結果

リサーチクエスチョン

  • RQ1非マルコフ的で階層的な人的行動構造を、将来予測を可能にする形でどのようにモデル化できるか?
  • RQ2物体のアフォーダンスと空間的文脈は、行動予測精度向上に果たす役割は何か?
  • RQ3確率的文法モデルは、RGB-D動画シーケンスにおける構成的イベント構造を効果的に捉えることができるか?
  • RQ4イアリーのアルゴリズムを用いた記号的解析は、エンドツーエンドのディープラーニングモデルと比較して、行動予測においてどのように異なるか?
  • RQ5部分的な動画観測のみを用いて、未観測の将来状態への一般化はどの程度可能か?

主な発見

  • 提案されたST-AOGモデルは、SVM、LSTM、VGG-16を含むベースライン手法を上回り、行動検出および将来行動予測のタスクで優れた性能を示した。
  • 確率的文法とイアリー解析の組み合わせにより、高い精度で将来の部分的行動の記号的予測が可能になった。
  • 物体のアフォーダンスと空間的文脈を組み込むことで、これらの要因を無視するモデルと比較して、予測性能が顕著に向上した。
  • 意味的イベント解析においても優れた結果を達成し、動画から階層的な行動構造を回復できる能力を示した。
  • ビタビ方式の推論を用いた解析尤度の計算により、予測された将来状態の信頼性の高い確率推定が得られた。
  • アブレーションスタディの結果、時間的文法と空間的文脈の両方のコンponentsが最適な性能を発揮するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。