Skip to main content
QUICK REVIEW

[论文解读] Attentive Action and Context Factorization

Yang Wang, Vinh Cao Trần|arXiv (Cornell University)|Apr 10, 2019
Human Pose and Action Recognition参考文献 27被引用 5
一句话总结

本文提出了一种注意力动作与上下文解耦方法,利用共轭视频样本——上下文相似但无动作的剪辑——来训练一种弱监督注意力机制,以实现人类动作的时空定位。该方法通过双时空注意力图学习分离动作与上下文特征,无需详细标注即可提升动作识别的准确率与可解释性。

ABSTRACT

We propose a method for human action recognition, one that can localize the spatiotemporal regions that `define' the actions. This is a challenging task due to the subtlety of human actions in video and the co-occurrence of contextual elements. To address this challenge, we utilize conjugate samples of human actions, which are video clips that are contextually similar to human action samples but do not contain the action. We introduce a novel attentional mechanism that can spatially and temporally separate human actions from the co-occurring contextual factors. The separation of the action and context factors is weakly supervised, eliminating the need for laboriously detailed annotation of these two factors in training samples. Our method can be used to build human action classifiers with higher accuracy and better interpretability. Experiments on several human action recognition datasets demonstrate the quantitative and qualitative benefits of our approach.

研究动机与目标

  • 解决在视频中定位定义人类动作的时空区域的挑战,其中动作细微且与上下文元素共现。
  • 通过利用上下文相似但无目标动作的共轭样本,减少对昂贵详细标注的依赖。
  • 通过注意力机制显式分离动作与上下文表征,提升模型可解释性。
  • 开发一种方法,在提升分类性能的同时,提供动作与上下文组件的视觉定位。

提出的方法

  • 使用包含动作视频及其共轭样本(上下文相似但无动作)的配对训练数据。
  • 采用双分支注意力机制,为动作与上下文组件分别生成独立的时空注意力图。
  • 应用空间与时间注意力,选择性地聚合相关视频区域的特征,实现解耦特征提取。
  • 优化联合目标:最小化分类损失,最大化动作与共轭样本之间上下文特征的相似性,同时最小化动作特征之间的相似性。
  • 采用3D CNN主干网络(如3D-Res34-RGB)进行特征提取,并对注意力加权特征应用全局平均池化。
  • 通过图像修复与混合技术,将框架适配至静态图像,生成Pascal VOC2012数据集的共轭样本。

实验结果

研究问题

  • RQ1弱监督注意力机制是否能在无需详细标注的情况下,有效定位视频中与动作相关的时空区域?
  • RQ2模型仅使用共轭样本时,能否有效解耦动作与上下文表征?
  • RQ3与基线注意力机制相比,该方法在多大程度上提升了动作识别的准确率与可解释性?
  • RQ4该方法在短时长视频剪辑(如HACS数据集中的样本)上表现如何?
  • RQ5该框架能否推广至静态图像,以实现动作与上下文的定位?

主要发现

  • 所提出的ActX方法在Pascal VOC2012数据集上达到80.2%的平均精度(mAP),优于先前最先进方法的75.2%。
  • 在HACS-30数据集上,ActX的mAP与mAcc均高于基线注意力机制,尽管由于视频时长短,性能提升较小。
  • 通过注意力图实现更好的可解释性,能清晰定位人类-物体交互(动作)与周围场景(上下文)。
  • 在ActionThread与Hollywood2数据集上的实验表明,该方法持续优于现有基于注意力的模型。
  • 动作与上下文的注意力图在视觉上连贯,动作图聚焦于人类-物体交互,上下文图聚焦于背景与场景元素。
  • 共轭样本的使用实现了有效的弱监督,消除了对动作与上下文像素级或边界框标注的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。