Skip to main content
QUICK REVIEW

[论文解读] Asynchronous Temporal Fields for Action Recognition

Gunnar A. Sigurdsson, Santosh Divvala|arXiv (Cornell University)|Dec 19, 2016
Human Pose and Action Recognition参考文献 57被引用 9
一句话总结

该论文提出了一种全连接的时序条件随机场(CRF)模型,通过卷积神经网络(ConvNet)提取的深度特征,联合推理人类动作的多个方面(如类别、物体、动作、进展和意图)。通过引入一种异步变分推理方法,该模型实现了对表达性强的结构化模型的高效端到端训练,在Charades基准上取得了22.4%的mAP,显著优于之前的最先进方法(17.2% mAP)。

ABSTRACT

Actions are more than just movements and trajectories: we cook to eat and we hold a cup to drink from it. A thorough understanding of videos requires going beyond appearance modeling and necessitates reasoning about the sequence of activities, as well as the higher-level constructs such as intentions. But how do we model and reason about these? We propose a fully-connected temporal CRF model for reasoning over various aspects of activities that includes objects, actions, and intentions, where the potentials are predicted by a deep network. End-to-end training of such structured models is a challenging endeavor: For inference and learning we need to construct mini-batches consisting of whole videos, leading to mini-batches with only a few videos. This causes high-correlation between data points leading to breakdown of the backprop algorithm. To address this challenge, we present an asynchronous variational inference method that allows efficient end-to-end training. Our method achieves a classification mAP of 22.4% on the Charades benchmark, outperforming the state-of-the-art (17.2% mAP), and offers equal gains on the task of temporal localization.

研究动机与目标

  • 为解决当前视频理解模型仅关注外观和运动的局限性,通过引入对意图和活动序列的高层推理。
  • 开发一种深度结构化模型,能够对视频中动作的长程时间依赖性和多种语义方面进行推理。
  • 在视频小批量样本间存在高度相关性的情况下,实现对表达性强的全连接时序CRF的端到端训练。
  • 通过结构化建模语义活动组件,提升动作识别和时间定位任务的性能。

提出的方法

  • 提出一种全连接时序CRF,其中每个帧的预测受所有其他帧的影响,从而实现超越局部邻域的长程时间推理。
  • 使用深度卷积神经网络(ConvNet)端到端预测CRF势函数,联合建模每个帧的动作类别、物体、动作、进展以及潜在意图。
  • 引入一种异步变分推理方法,通过使用最近迭代的结果来近似来自其他帧的消息传递,从而减轻小批量样本中的相关性问题。
  • 采用小批量整体视频的随机训练策略,通过强调最近计算帧的消息,提升训练稳定性和可扩展性。
  • 利用潜在意图变量作为连续分布,以建模目标导向行为,从而支持对长时视频语义的解释。
  • 应用t-SNE可视化与聚类分析,以研究学习到的意图表征,证明潜在空间中存在有意义的结构。

实验结果

研究问题

  • RQ1全连接时序CRF模型能否有效捕捉视频中动作、物体和意图之间的长程依赖与语义关系?
  • RQ2当小批量样本仅包含少数几段完整视频且样本间相关性极高时,如何使表达性强的结构化模型的端到端训练成为可能?
  • RQ3潜在意图建模在多大程度上能超越动作识别,提升对目标和意图的推理能力?
  • RQ4与标准反向传播相比,异步推理是否能实现对大规模视频数据集上深度结构化模型的稳定且高效的训练?
  • RQ5所提方法是否能在动作分类和时间定位任务上均优于LSTM和两流网络等强基线模型?

主要发现

  • 所提方法在Charades基准上达到22.4%的mAP,显著优于先前最先进方法(17.2% mAP)。
  • 在时间定位任务中,该模型优于基于LSTM的基线模型,经后处理后mAP达到12.8%,高于LSTM基线的11.6%。
  • 定性分析表明,模型学习到了有意义的意图表征,t-SNE可视化揭示了具有相似意图类型的视频呈现聚类现象。
  • 相同意图类型视频之间的平均距离为6.02×10⁻³,显著低于随机配对视频的平均距离(7.25×10⁻³),表明学习到的意图空间具有有意义的结构。
  • 该模型从后处理中获益程度高于LSTM基线,表明其在更长的时间尺度上进行推理,并从时间平滑中获益。
  • 异步训练方法实现了全连接CRF的稳定且可扩展的端到端学习,克服了标准SGD在视频小批量样本上的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。