Skip to main content
QUICK REVIEW

[论文解读] Actions ~ Transformations

Xiaolong Wang, Ali Farhadi|arXiv (Cornell University)|Dec 2, 2015
Human Pose and Action Recognition被引用 15
一句话总结

本文提出将动作表示为从先决条件(动作前状态)到结果(动作后状态)的视觉变换,通过孪生网络在深度特征空间中学习线性变换来建模动作。该方法在UCF101和HMDB51上取得最先进性能,并在新提出的ACT数据集上展现出强大的跨类别泛化能力,同时提升了语义检索与视觉预测能力。

ABSTRACT

What defines an action like "kicking ball"? We argue that the true meaning of an action lies in the change or transformation an action brings to the environment. In this paper, we propose a novel representation for actions by modeling an action as a transformation which changes the state of the environment before the action happens (precondition) to the state after the action (effect). Motivated by recent advancements of video representation using deep learning, we design a Siamese network which models the action as a transformation on a high-level feature space. We show that our model gives improvements on standard action recognition datasets including UCF101 and HMDB51. More importantly, our approach is able to generalize beyond learned action categories and shows significant performance improvement on cross-category generalization on our new ACT dataset.

研究动机与目标

  • 为解决当前动作识别模型因过度依赖外观和运动而过拟合于场景上下文的问题。
  • 通过将动作建模为环境状态变化,提升对已学习动作类别的泛化能力。
  • 构建一个新的基准数据集ACT,包含43个动作类别和11,234个视频,用于评估跨类别迁移性能。
  • 通过从先决条件状态学习推断结果状态,实现视觉预测。
  • 基于动作对环境的影响,提供更具语义基础的动作表征。

提出的方法

  • 将每个动作表示为从先决条件状态(动作前)到结果状态(动作后)的变换,受自然语言处理中先决条件与结果的启发。
  • 使用孪生双分支卷积神经网络,学习先决条件与结果状态深度特征之间的变换。
  • 采用对比损失进行网络训练,以促使模型学习将先决条件特征映射到结果特征的线性变换。
  • 向孪生网络的每个分支输入RGB帧和光流,以捕捉外观与运动动态。
  • 从每个分支的最后全连接层提取特征,并将它们拼接用于分类或检索。
  • 通过在训练集中检索与给定先决条件嵌入最相似的结果嵌入,实现视觉预测。

实验结果

研究问题

  • RQ1将动作建模为从先决条件到结果的变换,是否能提升在标准基准上的动作识别性能?
  • RQ2所提出的基于变换的表征是否能泛化到未见过的动作类别,例如从“打开窗户”泛化到“打开汽车尾箱”?
  • RQ3模型是否学习到语义上有意义的表征,聚焦于动作引起的环境变化,而非场景上下文?
  • RQ4模型能否通过从给定的先决条件状态推断可能的结果状态,实现准确的视觉预测?
  • RQ5与基于外观和运动的标准模型相比,基于变换的表征在检索与泛化方面表现如何?

主要发现

  • 所提方法在UCF101动作识别数据集上达到最先进性能,优于先前方法。
  • 在HMDB51数据集上,模型相较于基线方法有显著提升,尤其在处理动作变体方面表现突出。
  • 模型展现出强大的跨类别泛化能力:例如,在“跳高”上进行训练的模型,能成功识别测试中的“跳远”。
  • 最近邻检索结果表明,模型检索到的是语义相关的视频(如“推购物车”),而非视觉相似但语义错误的视频(如“爬行”)。
  • 梯度可视化显示,模型关注图像中发生改变的区域(如球或人物),而基线模型则关注整个场景。
  • 视觉预测结果表明,模型能检索出合理的可能结果帧——例如,从“跳板”状态预测出“跳入泳池”——展示了其建模动作变换的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。