Skip to main content
QUICK REVIEW

[论文解读] ActionFormer: Localizing Moments of Actions with Transformers

Chenlin Zhang, Jianxin Wu|arXiv (Cornell University)|Feb 16, 2022
Human Pose and Action Recognition被引用 15
一句话总结

ActionFormer 提出了一种单阶段、无锚点的 Transformer 模型用于动作时序定位,通过局部自注意力机制和轻量解码器对视频中的每个时刻进行分类,并回归动作边界。无需动作提议或锚点窗口,其在 THUMOS14 数据集上以 tIoU=0.5 的标准达到了 71.0% 的 mAP,相比之前的方法提升了 14.1 个百分点。

ABSTRACT

Self-attention based Transformer models have demonstrated impressive results for image classification and object detection, and more recently for video understanding. Inspired by this success, we investigate the application of Transformer networks for temporal action localization in videos. To this end, we present ActionFormer -- a simple yet powerful model to identify actions in time and recognize their categories in a single shot, without using action proposals or relying on pre-defined anchor windows. ActionFormer combines a multiscale feature representation with local self-attention, and uses a light-weighted decoder to classify every moment in time and estimate the corresponding action boundaries. We show that this orchestrated design results in major improvements upon prior works. Without bells and whistles, ActionFormer achieves 71.0% mAP at tIoU=0.5 on THUMOS14, outperforming the best prior model by 14.1 absolute percentage points. Further, ActionFormer demonstrates strong results on ActivityNet 1.3 (36.6% average mAP) and EPIC-Kitchens 100 (+13.5% average mAP over prior works). Our code is available at http://github.com/happyharrycn/actionformer_release.

研究动机与目标

  • 开发一种简单但强大的基于 Transformer 的模型,用于时序动作定位,且不依赖动作提议或锚点窗口。
  • 探究局部自注意力机制与特征金字塔融合在建模长时序依赖关系方面的有效性,以提升动作定位性能。
  • 在包括未剪辑视频和第一视角视频在内的多种基准上,建立一个强大的单阶段基线模型。
  • 证明仅使用标准分类损失和回归损失的极简设计,能够超越复杂的两阶段或锚点基模型。

提出的方法

  • ActionFormer 使用双流 I3D 或 SlowFast 主干网络提取视频的多尺度特征表示,随后通过特征金字塔将每个时刻表示为候选样本。
  • 应用局部自注意力机制,以在特征金字塔上建模长时序上下文,使模型能够捕捉不同动作候选之间的依赖关系。
  • 采用轻量级卷积解码器,对每个候选样本进行动作类别分类,并回归其到真实动作起始和结束时间的距离。
  • 使用标准交叉熵损失进行分类,平滑 L1 损失进行边界回归,通过端到端优化进行训练。
  • 推理阶段通过解码预测得分和偏移量,生成带有时间边界和标签的动作实例。
  • 该方法在不同数据集上统一应用,输入特征根据分辨率、帧率和模态(例如,THUMOS14 使用双流 I3D,EPIC-Kitchens 使用 SlowFast)进行适配。

实验结果

研究问题

  • RQ1单阶段、无锚点的 Transformer 模型是否能在不使用动作提议或预定义锚点窗口的情况下,实现时序动作定位的最先进性能?
  • RQ2局部自注意力机制在建模未剪辑视频中长时序依赖关系方面有多有效?
  • RQ3在多种基准上,一个简单统一的架构配合标准损失函数,能在多大程度上超越复杂的两阶段或锚点基模型?
  • RQ4该模型在不同视频领域(包括未剪辑、长时视频和第一视角视频)上的泛化能力如何?

主要发现

  • 在 THUMOS14 基准上,ActionFormer 在 tIoU=0.5 时达到 71.0% 的 mAP,相比最佳先前方法提升了 14.1 个百分点的绝对值。
  • 在 ActivityNet 1.3 上,ActionFormer 达到 36.6% 的平均 mAP,展现出对长尾、多样化动作分布的强大泛化能力。
  • 在具有挑战性的 EPIC-Kitchens 100 数据集上,ActionFormer 相比先前工作将平均 mAP 提升了超过 13.5 个百分点,凸显其在第一视角动作定位中的有效性。
  • 该模型通过极简设计实现上述性能,仅使用标准分类和回归损失,无需复杂的提议生成或解码流程。
  • 大量消融实验验证了局部自注意力和特征金字塔的重要性,当移除这些组件时性能出现显著下降。
  • 该方法在不同硬件和环境间具有可复现性,EPIC-Kitchens 上 mAP 变化极小(≤0.8%),证实了其鲁棒性和可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。