Skip to main content
QUICK REVIEW

[论文解读] Predicting Human Activities Using Stochastic Grammar

Siyuan Qi, Siyuan Huang|arXiv (Cornell University)|Aug 2, 2017
Human Pose and Action Recognition参考文献 2被引用 3
一句话总结

本文提出一种基于随机语法的模型,采用时空与或图(ST-AOG)从部分观测的RGB-D视频中预测未来人类活动。该模型通过时间随机语法与Earley解析,整合人类动作、物体及功能属性,推断未来子活动及其相关标签,在基准数据集上实现了语义事件解析与未来活动预测的最先进性能。

ABSTRACT

This paper presents a novel method to predict future human activities from partially observed RGB-D videos. Human activity prediction is generally difficult due to its non-Markovian property and the rich context between human and environments. We use a stochastic grammar model to capture the compositional structure of events, integrating human actions, objects, and their affordances. We represent the event by a spatial-temporal And-Or graph (ST-AOG). The ST-AOG is composed of a temporal stochastic grammar defined on sub-activities, and spatial graphs representing sub-activities that consist of human actions, objects, and their affordances. Future sub-activities are predicted using the temporal grammar and Earley parsing algorithm. The corresponding action, object, and affordance labels are then inferred accordingly. Extensive experiments are conducted to show the effectiveness of our model on both semantic event parsing and future activity prediction.

研究动机与目标

  • 建模人类活动的层次化与组合结构,超越马尔可夫假设。
  • 实现实时推理当前活动状态并基于部分视频观测预测未来动作。
  • 联合建模人类动作、交互物体及物体功能属性,以捕获更丰富的时空上下文。
  • 通过符号推理与概率语法规则应对从大规模未来状态空间中进行预测的挑战。

提出的方法

  • 使用时空与或图(ST-AOG)表示人类活动,将时间随机语法(T-AOG)与空间图(S-AOG)结合,用于子活动建模。
  • 将子活动表示为随机上下文无关语法规则中的非终结符,终端符号代表动作-物体-功能三元组。
  • 利用Earley解析算法基于当前观测与语法规则进行符号化预测,推断下一个子活动。
  • 通过Viterbi风格推理计算解析似然,估计预测序列的概率。
  • 通过结合解析后的子活动预测与学习到的特征表示,推断动作、物体及功能标签。
  • 在训练过程中,采用0.5的覆盖率阈值与4大小的上下文窗口,用于自举等价类。

实验结果

研究问题

  • RQ1如何建模人类活动的非马尔可夫、层次化结构,以支持未来预测?
  • RQ2物体功能属性与空间上下文在提升活动预测准确率中起到何种作用?
  • RQ3随机语法模型能否有效捕捉RGB-D视频序列中的组合事件结构?
  • RQ4与端到端深度学习模型相比,使用Earley算法的符号解析在活动预测中表现如何?
  • RQ5在仅依赖部分视频观测的情况下,该模型在多大程度上能泛化到未见的未来状态?

主要发现

  • 所提出的ST-AOG模型在动作检测与未来活动预测任务中,优于SVM、LSTM与VGG-16等基线方法。
  • 采用随机语法与Earley解析可实现对未来子活动的高效符号化预测,且准确率较高。
  • 引入物体功能属性与空间上下文显著提升了预测性能,相较忽略这些因素的模型表现更优。
  • 该模型在语义事件解析任务中表现优异,证明其能从视频中恢复出层次化的活动结构。
  • 通过Viterbi风格推理计算的解析似然,为预测的未来状态提供了可靠的概率估计。
  • 消融实验确认,时间语法与空间上下文组件对实现最优性能均至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。