[论文解读] GTA: Global Temporal Attention for Video Action Understanding
本文提出全局时间注意力(GTA),一种解耦的注意力机制,通过学习一个全局、实例无关的注意力矩阵,显式建模视频帧之间的时序关系,同时在像素和语义区域层面应用。GTA 在不依赖成对帧交互的前提下改进了时序建模,实现了在三个视频动作识别基准上的最先进性能,且计算开销极低。
Self-attention learns pairwise interactions to model long-range dependencies, yielding great improvements for video action recognition. In this paper, we seek a deeper understanding of self-attention for temporal modeling in videos. We first demonstrate that the entangled modeling of spatio-temporal information by flattening all pixels is sub-optimal, failing to capture temporal relationships among frames explicitly. To this end, we introduce Global Temporal Attention (GTA), which performs global temporal attention on top of spatial attention in a decoupled manner. We apply GTA on both pixels and semantically similar regions to capture temporal relationships at different levels of spatial granularity. Unlike conventional self-attention that computes an instance-specific attention matrix, GTA directly learns a global attention matrix that is intended to encode temporal structures that generalize across different samples. We further augment GTA with a cross-channel multi-head fashion to exploit channel interactions for better temporal modeling. Extensive experiments on 2D and 3D networks demonstrate that our approach consistently enhances temporal modeling and provides state-of-the-art performance on three video action recognition datasets.
研究动机与目标
- 为解决传统自注意力在视频动作识别中空间与时间建模纠缠且偏向外观相似性的问题。
- 探究点积自注意力是否在时序建模中为最优选择,鉴于其排列不变性及实例特定的注意力权重。
- 通过学习一个全局、任务特定的注意力矩阵,实现跨样本的泛化,而非依赖成对帧交互,以改进时序建模。
- 通过在像素和语义相似区域(超像素)上应用GTA,探索多层级空间粒度。
- 通过跨通道多头注意力机制,利用通道间交互,增强时序建模。
提出的方法
- 将时空自注意力解耦为两个阶段:首先在每帧内应用标准自注意力进行空间建模,然后应用GTA实现跨帧的全局时间注意力。
- 学习一个全局、实例无关的注意力矩阵,编码不同视频样本间可泛化的时序结构,避免实例特定的成对交互。
- 在像素级和区域级(超像素)均应用GTA,以捕捉多层级空间粒度的时序关系。
- 引入跨通道多头机制,沿通道维将特征图划分为若干组,使每个头可关注输入的不同方面。
- 使用可学习的全局注意力矩阵,初始随机初始化,通过端到端训练,使其关注对动作识别至关重要的关键帧。
- 像素级与区域级GTA结合跨通道多头注意力可提升性能,尤其当组大小设为8时效果最佳。
实验结果
研究问题
- RQ1标准自注意力中空间与时间信息的纠缠建模是否对视频动作识别次优?
- RQ2与实例特定的成对注意力相比,全局、实例无关的注意力矩阵在时序建模中是否能更好地跨样本泛化?
- RQ3通过解耦空间与时间注意力,是否能通过减少对外观相似性的偏差来提升性能?
- RQ4在多级空间粒度(像素与区域)上建模时序关系,是否能增强动作识别?
- RQ5跨通道多头注意力是否有助于提升全局注意力机制中的时序建模?
主要发现
- GTA在三个视频动作识别基准上均取得最先进性能:SSv1(49.6%)、SSv2(54.8%)和Kinetics-400(83.4%),且计算成本极低。
- 仅使用像素级GTA在SSv1上比带位置编码的时间自注意力(TAPE)高出0.5%,证明其在建模时序顺序方面更有效。
- 在语义区域(Region GTA)上应用GTA带来的性能增益高于仅在像素上应用,尤其在结合跨通道多头注意力时增益更大(1.0% vs. 0.3%无CCMH)。
- 在SSv1和SSv2上,跨通道多头机制中组数为8时性能最优,组数过大则因每组通道数不足而性能下降。
- 采用GTA的解耦框架显著优于原始非局部块及其变体(如CGNL和GCNet),后者的性能较差源于空间-时间-通道建模的纠缠。
- 时间自注意力中的位置编码可提升性能9.6%,但GTA仍超越其表现,证实其在不依赖位置提示的情况下仍能有效捕捉时序顺序。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。