Skip to main content
QUICK REVIEW

[论文解读] Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention

Juan-Manuel Pérez-Rúa, Brais Martínez|arXiv (Cornell University)|Apr 2, 2020
Human Pose and Action Recognition参考文献 61被引用 17
一句话总结

本文提出了一种名为 What-Where-When(W3)的视频注意力模块,这是一种轻量级、因子分解的架构,能够联合建模视频动作识别中的‘内容’(what)、‘空间位置’(where)和‘时间动态’(when)。通过将特征图分解为一维通道张量和二维空间张量,并应用高效的时序推理,W3在 Something-Something V2 和 EPIC-Kitchens 等基准上实现了最先进(SOTA)的准确率,且仅比 TSM 多出 1.5–3.2% 的 FLOPs。

ABSTRACT

Attentive video modeling is essential for action recognition in unconstrained videos due to their rich yet redundant information over space and time. However, introducing attention in a deep neural network for action recognition is challenging for two reasons. First, an effective attention module needs to learn what (objects and their local motion patterns), where (spatially), and when (temporally) to focus on. Second, a video attention module must be efficient because existing action recognition models already suffer from high computational cost. To address both challenges, a novel What-Where-When (W3) video attention module is proposed. Departing from existing alternatives, our W3 module models all three facets of video attention jointly. Crucially, it is extremely efficient by factorizing the high-dimensional video feature data into low-dimensional meaningful spaces (1D channel vector for `what' and 2D spatial tensors for `where'), followed by lightweight temporal attention reasoning. Extensive experiments show that our attention model brings significant improvements to existing action recognition models, achieving new state-of-the-art performance on a number of benchmarks.

研究动机与目标

  • 为解决在无约束视频中建模时空注意力的挑战,其中冗余的空间和时间信息会阻碍判别性表征学习。
  • 设计一种视频注意力机制,联合建模‘内容’(内容注意力)、‘空间位置’(空间关注)和‘时间动态’(时间动态)——这一方面在以往工作中常被忽视。
  • 在计算开销极小的前提下实现高性能,使注意力机制在真实世界视频动作识别系统中可行。
  • 克服深度视频注意力模块的训练不稳定性问题,特别是 I3D 和 TSM 等深层网络中的梯度消失问题。
  • 开发一种训练策略,使复杂且因子分解的注意力模块能够实现端到端训练,且性能无明显下降。

提出的方法

  • W3 模块将视频特征分解为两部分:用于‘内容’(基于内容的注意力)的一维通道向量,以及用于‘空间’(空间注意力)的二维空间张量,从而实现高效计算。
  • 分别使用轻量级的一维和三维卷积神经网络对两部分应用时序推理,使模型能够学习随时间演化的注意力模式。
  • 引入一种注意力引导的特征优化模块,以在反向传播过程中改善流向注意力模块的梯度流动。
  • 提出成熟特征引导正则化(MFR),作为一种分阶段的自知识蒸馏技术,以稳定训练并避免陷入不良局部极小值。
  • 将 W3 模块作为即插即用的模块插入到现有动作识别模型(如 TSM 和 I3D)中,实现端到端训练,且 FLOPs 增加极少。
  • 使用标准交叉熵损失进行训练,配合数据增强和混合精度训练;推理时采用单个片段并使用中心裁剪。

实验结果

研究问题

  • RQ1是否能够设计一种统一的视频注意力机制,以联合建模‘内容’、‘空间’与‘时间’,在不增加计算成本的前提下提升动作识别准确率?
  • RQ2将通道注意力与空间注意力因子分解为独立的低维组件,对视频动作识别的性能与效率有何影响?
  • RQ3为稳定包含时序推理组件的深度视频注意力模块的训练,需要哪些训练策略?
  • RQ4与 CBAM 和 Non-Local 等现有注意力机制相比,所提出的 W3 模块在准确率与效率方面表现如何?
  • RQ5在推理过程中,该注意力机制在多大程度上捕获了语义上有意义的时空区域?与静态空间注意力有何不同?

主要发现

  • 当添加到 TSM 主干网络时,W3 模块在 Something-Something V2 上实现了 52.6% 的 Top-1 准确率,比基线 TSM 模型高出 5.4 个百分点。
  • 仅比 TSM 多出 1.5–3.2% 的额外 FLOPs,W3 的性能已超过 Non-Local 模块(FLOPs 从 65.0 增加到 115.0 GFLOPs,增幅达 75.8%)。
  • 若移除成熟特征引导正则化(MFR)组件,Top-1 准确率将从 52.6% 降至 50.3%,证明 MFR 在模型稳定性和性能方面具有关键作用。
  • 消融实验表明,时序注意力比空间注意力更为重要:若移除时序注意力,准确率将下降 5.4 个百分点(从 52.6% 降至 47.2%)。
  • 当与 CBAM 结合时,MFR 可带来额外 1.4% 的准确率提升;而当与 W3 结合时,增益达到 2.4%,表明更丰富的时空特征能增强正则化过程。
  • 可视化结果表明,W3 仅在动作活跃阶段施加注意力,并能捕捉相关上下文(如物体、手部、场景),而 CBAM 则始终应用静态空间注意力,与动作状态无关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。