Skip to main content
QUICK REVIEW

[论文解读] Relational Action Forecasting

Chen Sun, Abhinav Shrivastava|arXiv (Cornell University)|Apr 8, 2019
Human Pose and Action Recognition参考文献 72被引用 7
一句话总结

该论文提出了一种基于图的模型——判别性关系循环网络(DR²N),通过Faster R-CNN生成的行人提议和带有注意力机制的关系学习的循环图结构,联合建模视频中多个主体之间的时空交互。该方法在动作预测任务中达到最先进性能(在J-HMDB数据集上实现早期动作分类60%的准确率),并在AVA数据集上通过有效建模动态且具有判别性的交互关系,实现了未来动作预测的显著提升,且无需显式的关系监督。

ABSTRACT

This paper focuses on multi-person action forecasting in videos. More precisely, given a history of H previous frames, the goal is to detect actors and to predict their future actions for the next T frames. Our approach jointly models temporal and spatial interactions among different actors by constructing a recurrent graph, using actor proposals obtained with Faster R-CNN as nodes. Our method learns to select a subset of discriminative relations without requiring explicit supervision, thus enabling us to tackle challenging visual data. We refer to our model as Discriminative Relational Recurrent Network (DRRN). Evaluation of action prediction on AVA demonstrates the effectiveness of our proposed method compared to simpler baselines. Furthermore, we significantly improve performance on the task of early action classification on J-HMDB, from the previous SOTA of 48% to 60%.

研究动机与目标

  • 为解决仅使用过去和当前帧来预测多主体在视频中未来高层动作的挑战。
  • 在不依赖关系标注的情况下,联合建模主体之间的时序动态与空间交互。
  • 在单帧中主体身份和动作模糊的现实世界、噪声视觉数据中,提升动作预测性能。
  • 通过从视觉历史中预测合理未来动作,支持自动驾驶系统和人机交互等实际应用。
  • 在动作预测和早期动作分类任务中均优于现有基线方法。

提出的方法

  • 构建一个完全连接的图结构,其中节点表示行人提议(来自Faster R-CNN),边表示主体之间的潜在交互。
  • 采用改进的图注意力网络(GAT),通过可学习的注意力权重动态选择具有判别性的主体间关系,使模型能够忽略噪声或无关交互。
  • 集成基于GRU的循环单元,建模主体表征在时间维度上的演化,捕捉序列性动作模式。
  • 以弱监督方式训练模型:仅在未来的时步提供动作类别的真实标签,不使用边或关系的标注。
  • 采用联合优化目标,在最大化动作分类性能的同时,学习关注相关主体间关系。
  • 将模型应用于两个任务:AVA数据集上的多人动作预测和J-HMDB数据集上的早期动作分类,共享特征提取主干网络并使用任务特定的分类头。

实验结果

研究问题

  • RQ1基于图的循环模型是否能仅利用视觉历史且无需显式关系监督,有效预测多主体在视频中的未来动作?
  • RQ2与独立建模相比,主体间的空间交互与时序动态如何协同提升未来动作预测性能?
  • RQ3弱监督关系学习机制在复杂、噪声较多的视频场景中,能在多大程度上识别出具有判别性的主体交互?
  • RQ4所提出的DR²N框架是否在动作预测和早期动作分类任务中均优于强基线方法?
  • RQ5哪些类型的动作最受益于关系建模?情境或交互线索在预测准确率中起到何种作用?

主要发现

  • 在J-HMDB数据集上,DR²N在仅使用视频片段前10%时间的早期动作分类任务中达到60.6%的准确率,显著优于此前最先进方法的48%。
  • 在AVA数据集上,DR²N在所有未来动作预测任务中均优于所有基线模型,且在所有预测时延(t=1至t=5)下均保持一致的性能提升。
  • 模型在涉及明确交互动作(如击掌、武术动作)和依赖上下文的动作(如进食、骑乘)中表现最佳,表明关系建模提供了关键线索。
  • 消融实验表明,基于GRU的时序建模优于静态或单头基线模型;注意力机制的关系学习(DR²N)在关系选择上也优于均匀采样(RN)和标准GAT方法。
  • 注意力权重的可视化结果表明,DR²N能够有效关注到相关主体和上下文物体(如马、桌子),证明其具备良好的上下文推理能力。
  • 模型在t=0时刻保持了强大的检测性能,同时实现了更优的未来预测表现,表明关系建模与时序建模并未损害定位精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。