[论文解读] Alignment-guided Temporal Attention for Video Action Recognition
本文提出了一种参数无关、即插即用的模块——对齐引导时序注意力(ATA),通过在应用时序注意力之前对相邻帧之间的空间块进行对齐,从而提升视频动作识别性能。通过使用库恩-蒙克雷斯算法(Kuhn-Munkres algorithm)逐帧对齐空间块,以增强帧表示之间的互信息,ATA 在保持因子化 2D+1D 方法效率的同时,实现了与联合 3D 注意力相当的性能,在 Kinetics-400 和 Something-Something V2 上优于现有方法,且计算开销极低。
Temporal modeling is crucial for various video learning tasks. Most recent approaches employ either factorized (2D+1D) or joint (3D) spatial-temporal operations to extract temporal contexts from the input frames. While the former is more efficient in computation, the latter often obtains better performance. In this paper, we attribute this to a dilemma between the sufficiency and the efficiency of interactions among various positions in different frames. These interactions affect the extraction of task-relevant information shared among frames. To resolve this issue, we prove that frame-by-frame alignments have the potential to increase the mutual information between frame representations, thereby including more task-relevant information to boost effectiveness. Then we propose Alignment-guided Temporal Attention (ATA) to extend 1-dimensional temporal attention with parameter-free patch-level alignments between neighboring frames. It can act as a general plug-in for image backbones to conduct the action recognition task without any model-specific design. Extensive experiments on multiple benchmarks demonstrate the superiority and generality of our module.
研究动机与目标
- 为解决视频时序建模中跨帧、跨位置交互的效率与充分性之间的权衡问题。
- 通过显式对齐提升帧表示之间的互信息,改善与任务相关的信息提取。
- 设计一种通用、即插即用的模块,可与基于图像的主干网络兼容,用于视频动作识别。
- 证明对齐引导注意力在准确率与效率上均优于因子化和联合空间-时序注意力机制。
提出的方法
- 提出对齐引导时序注意力(ATA)作为即插即用模块,在相邻帧之间对齐空间块后应用时序自注意力。
- 使用库恩-蒙克雷斯算法(Kuhn-Munkres Algorithm, KMA)基于相邻帧特征之间的余弦相似度,计算最优的块级对齐。
- 仅在对齐的特征对上应用时序注意力,通过注意力后的去对齐操作保留空间结构。
- 提出理论证明:逐帧对齐可增加帧表示之间的互信息,从而增强与任务相关特征的学习。
- 通过避免完整 3D 注意力,保持计算效率,复杂度为 O(TH³W³ + TH²W²d + T²HWd),低于联合 3D 注意力。
- 设计为可与标准图像 Transformer(如 ViT、TimeSformer、ConvNeXt)无缝兼容,无需架构修改。
实验结果
研究问题
- RQ1在视频建模中,相邻帧之间显式的块级对齐是否能提升帧表示之间的互信息?
- RQ2对齐引导注意力是否在视频动作识别中优于因子化(2D+1D)和联合(3D)空间-时序注意力?
- RQ3参数无关、基于对齐的模块能否有效嵌入现有图像识别主干网络中用于视频动作识别?
- RQ4对齐模块的数量如何影响性能?最优的插入位置在哪里以获得最大增益?
主要发现
- 在 Kinetics-400 上,ATA 达到 79.6% 的 top-1 准确率,优于因子化注意力(78.0%)和联合注意力(77.4%),同时保持相似的 FLOPs 和参数量。
- 在 Something-Something V2 上,ATA 相较于无对齐的基线模型,top-1 准确率提升 1.6%,展现出更强的运动建模能力。
- 将 ATA 插入单个阶段(如第 0–2 个块)即可带来 1.3% 的准确率增益,表明即使最小程度集成,对齐机制也极为有效。
- 加入 ATA 的模型在运动物体(如动作序列中的头部)上表现出更集中的激活,而基线注意力常因固定的空时注意力模式而激活静态背景。
- ATA 的复杂度主要由 KMA 步骤主导(O(TH³W³)),但仍低于联合 3D 注意力(O(T²H²W²d)),使其在长视频上更具可扩展性。
- 定性分析表明,ATA 保持了空间一致性,并增强了对运动线索的激活,而平均池化或标准注意力则会模糊或错位动态内容。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。