[论文解读] Adaptive Perception Transformer for Temporal Action Localization
本文提出 AdaPerFormer,一种基于双分支时序感知注意力(TAA)机制的端到端动作定位框架,通过全局感知注意力和双向卷积移位,有效建模全局长距离依赖与局部帧内及帧间上下文,无需锚点或提议框,在 THUMOS14 上实现 59.3% 的 mAP,在 ActivityNet-1.3 上实现 35.1% 的 mAP,达到当前最优性能。
Temporal action localization aims to predict the boundary and category of each action instance in untrimmed long videos. Most of previous methods based on anchors or proposals neglect the global-local context interaction in entire video sequences. Besides, their multi-stage designs cannot generate action boundaries and categories straightforwardly. To address the above issues, this paper proposes a end-to-end model, called Adaptive Perception transformer (AdaPerFormer for short). Specifically, AdaPerFormer explores a dual-branch attention mechanism. One branch takes care of the global perception attention, which can model entire video sequences and aggregate global relevant contexts. While the other branch concentrates on the local convolutional shift to aggregate intra-frame and inter-frame information through our bidirectional shift operation. The end-to-end nature produces the boundaries and categories of video actions without extra steps. Extensive experiments together with ablation studies are provided to reveal the effectiveness of our design. Our method obtains competitive performance on the THUMOS14 and ActivityNet-1.3 dataset.
研究动机与目标
- 为解决基于锚点或提议的方法在时序动作定位中的局限性,如启发式设计、边界定位精度差以及上下文建模碎片化。
- 实现无需依赖不可微后处理步骤的端到端动作边界与类别预测。
- 通过轻量化、高效的注意力机制,同时建模未剪辑视频中的全局长距离依赖与局部时序连续性。
- 通过引入双分支注意力设计,克服标准自注意力机制在计算成本高和时序顺序建模差方面的缺陷。
提出的方法
- 提出一种双分支时序感知注意力(TAA)机制:一个分支采用基于稀疏窗口的自注意力机制,实现对全视频序列的全局感知注意力,以建模长距离依赖。
- 引入局部卷积移位分支,沿时间维和通道维应用双向移位操作,以捕捉帧内与帧间局部上下文。
- 采用可学习的加权融合方式融合两个 TAA 分支,使网络能够在每一层自适应地平衡全局与局部表征。
- 采用简单的编码器-解码器架构,无需锚点或提议框,实现动作边界与类别的直接端到端预测。
- 应用固定窗口大小(如 5、7)的窗口化全局注意力,以降低计算量,同时保留全局上下文信息,避免密集注意力机制带来的高成本。
- 利用双向移位操作,通过在时间与通道维度上双向传递特征,增强局部特征聚合能力。
实验结果
研究问题
- RQ1双分支注意力机制是否能有效建模未剪辑视频中时序动作定位的全局长距离依赖与局部时序连续性?
- RQ2用端到端框架替代基于锚点或提议的设计,是否能提升定位精度与边界定位精度?
- RQ3稀疏全局注意力与局部卷积移位的结合,在性能与效率方面是否优于标准自注意力机制?
- RQ4窗口大小、移位大小与注意力加权的最优配置是什么?
主要发现
- AdaPerFormer 在 THUMOS14 数据集上达到 59.3% 的平均平均精度(mAP),超越以往基于锚点或提议的方法的最先进性能。
- 在 ActivityNet-1.3 数据集上,AdaPerFormer 获得 35.1% 的 mAP,表现出与现有方法相当的竞争力。
- 消融实验表明,双分支设计显著提升性能,其中局部卷积移位分支的贡献大于全局感知分支。
- 全局感知注意力的最优窗口大小为 5,实现 59.3% 的 mAP;更大的窗口(如 7 或 11)会轻微降低性能。
- 编码器与解码器中均采用双向移位操作时性能最佳(mAP 为 59.1%),优于单向或无移位设置。
- 在两个 TAA 分支上采用可学习注意力权重(总和为 1)时性能最佳(mAP 为 59.3%),而固定或对称权重会降低准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。