Skip to main content
QUICK REVIEW

[论文解读] Action Classification and Highlighting in Videos

Atousa Torabi, Leonid Sigal|arXiv (Cornell University)|Aug 31, 2017
Human Pose and Action Recognition参考文献 49被引用 5
一句话总结

该论文提出了一种基于注意力机制的LSTM模型,通过关注显著的视觉特征(如物体、场景和动作)来联合执行视频中的动作分类与帧突出显示。通过利用VGG-19网络在这些语义类别上的互补特征,该模型在ActivityNet数据集上实现了最先进性能,mAP提升高达54.2%,相比普通LSTM和CNN基线模型性能提升超过8个百分点。

ABSTRACT

Inspired by recent advances in neural machine translation, that jointly align and translate using encoder-decoder networks equipped with attention, we propose an attentionbased LSTM model for human activity recognition. Our model jointly learns to classify actions and highlight frames associated with the action, by attending to salient visual information through a jointly learned soft-attention networks. We explore attention informed by various forms of visual semantic features, including those encoding actions, objects and scenes. We qualitatively show that soft-attention can learn to effectively attend to important objects and scene information correlated with specific human actions. Further, we show that, quantitatively, our attention-based LSTM outperforms the vanilla LSTM and CNN models used by stateof-the-art methods. On a large-scale youtube video dataset, ActivityNet, our model outperforms competing methods in action classification.

研究动机与目标

  • 解决视频中人类动作识别面临的持续时间、视角和视觉杂波高度可变的挑战。
  • 通过整合时间上下文和对显著视觉线索的选择性注意,提升动作识别性能。
  • 实现端到端学习,联合完成动作分类与相关帧的突出显示。
  • 探索对多种语义特征(物体、场景和动作)进行注意力机制处理在提升性能方面的有效性。

提出的方法

  • 采用编码器-解码器LSTM架构,结合软注意力机制,动态聚焦于视频中相关的时间片段。
  • 使用C3D网络编码视频帧以提取时空特征,使用在物体、场景和动作分类任务上微调过的VGG-19网络提取语义特征。
  • 在每个时间步计算注意力权重,以关注最相关的视觉表征,并将其整合到LSTM隐藏状态中。
  • 采用可微分注意力机制,支持端到端训练,使模型能够学习视频中对动作识别最具信息量的区域。
  • 结合多个注意力头,分别关注不同语义模态(物体、场景、动作),并通过平均融合其预测结果。
  • 同时使用VGG-19模型的fc6和fc8层特征,其中fc8层始终表现更优。

实验结果

研究问题

  • RQ1与标准LSTM和CNN基线模型相比,基于注意力机制的LSTM模型是否能同时提升视频中的动作分类与帧突出显示性能?
  • RQ2对互补语义特征(物体、场景和动作)进行注意力机制处理,是否能显著提升动作识别性能?
  • RQ3不同注意力机制(如帧级注意力与最终状态注意力)如何影响识别性能?
  • RQ4当组合使用时,关注不同语义特征(物体、场景、动作)的模型在多大程度上能够相互补充?
  • RQ5在存在视觉杂波的情况下,注意力机制是否仍能学习到突出语义相关的视觉线索?

主要发现

  • 所提出的基于注意力机制的LSTM在ActivityNet数据集上的mAP性能相比普通LSTM和CNN模型提升了8个百分点以上。
  • 对在物体、场景和动作上微调过的VGG-19特征进行注意力机制处理,相比表现最佳的单一模型,性能最高提升5.6个百分点。
  • 同时关注三种语义模态(物体、场景、动作)的联合模型在ActivityNet上实现了最高的mAP(54.2%)和AC(52.8%)。
  • 在如“加油”和“安装汽车音响”等特定动作类别上,模型准确率提升超过30%,这些动作包含易于检测的物体。
  • 在每个时间步计算注意力(图4a)的架构性能优于仅在最终步骤计算注意力(图4b)的架构。
  • 定性分析表明,注意力机制能持续突出语义相关的物体和场景,从而增强模型的可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。