[论文解读] Encouraging LSTMs to Anticipate Actions Very Early
本文提出了一种新颖的多阶段LSTM架构,并引入一种新的预测损失函数,以鼓励在视频序列中尽早预测动作。通过联合建模上下文感知和动作感知特征,该方法实现了最先进性能,在JHMDB-21上比之前的方法高出22.0%,在UT-Interaction上高出14.0%,在UCF-101上对于极早期预测(例如视频序列的1%)高出49.9%。
In contrast to the widely studied problem of recognizing an action given a complete sequence, action anticipation aims to identify the action from only partially available videos. As such, it is therefore key to the success of computer vision applications requiring to react as early as possible, such as autonomous navigation. In this paper, we propose a new action anticipation method that achieves high prediction accuracy even in the presence of a very small percentage of a video sequence. To this end, we develop a multi-stage LSTM architecture that leverages context-aware and action-aware features, and introduce a novel loss function that encourages the model to predict the correct class as early as possible. Our experiments on standard benchmark datasets evidence the benefits of our approach; We outperform the state-of-the-art action anticipation methods for early prediction by a relative increase in accuracy of 22.0% on JHMDB-21, 14.0% on UT-Interaction and 49.9% on UCF-101.
研究动机与目标
- 解决从极短视频序列中预测动作的挑战,这对自动驾驶等实时应用至关重要。
- 克服现有损失函数无法有效促进早期正确预测的局限,尤其是在输入帧数极少时。
- 开发一种模型,有效结合上下文感知和动作感知特征,而无需依赖昂贵的光流计算。
- 在视频输入的最早阶段提升预测准确率,从而在安全关键场景中实现更快的系统响应。
提出的方法
- 提出一种多阶段LSTM(MS-LSTM),首先从完整RGB帧中提取上下文感知特征,然后将这些特征与定位在动作相关区域的动作感知特征进行融合。
- 使用类别特定的激活图生成动作感知特征,使模型能够聚焦于视频中具有判别性的部分,而无需依赖光流。
- 设计一种新颖的预测损失函数,该损失函数在序列早期阶段对假阴性进行惩罚,同时在模糊的早期阶段降低对假阳性的惩罚。
- 对特征图应用平均池化以稳定训练过程并提升早期预测性能。
- 端到端训练模型,使用交叉熵损失与新设计的预测损失相结合,后者可动态调整早期预测的重要性。
- 避免依赖光流或基于运动的特征,显著提升推理速度(在单张GPU上比双流基线快14倍)。
实验结果
研究问题
- RQ1是否可以设计一种损失函数,明确鼓励模型在视频序列中尽可能早地做出正确预测?
- RQ2与仅使用其中一种特征相比,结合上下文感知和动作感知特征在早期动作预测中能带来多大提升?
- RQ3在不牺牲性能的前提下,消除光流计算能在多大程度上提升效率?
- RQ4当仅观察到1%的视频时,所提方法是否能显著超越最先进方法的准确率?
主要发现
- 在仅使用1%视频序列输入的情况下,所提出的预测损失在JHMDB-21上比最先进方法实现了22.0%的相对准确率提升。
- 在UT-Interaction数据集上,该方法在相同早期预测设置下,相比先前方法准确率提升了14.0%。
- 在UCF-101上,该方法在1%视频输入时实现了49.9%的相对准确率增益,展现出卓越的早期预测能力。
- 仅观察到2帧(在30fps下约为1/15秒)时,该模型的准确率已与其它模型使用30–40帧时相当,实现了约1秒的提前预测。
- 上下文感知与动作感知特征的结合在UCF-101上实现了K=1(第一帧)时80.5%的准确率,显著优于仅使用单一特征类型的模型(仅上下文为62.80%,仅动作为69.33%)。
- 该模型处理50帧视频的速度比使用光流的双流基线快14倍,证明了其在不损失性能的前提下具有极高的效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。