Skip to main content
QUICK REVIEW

[论文解读] Transformers in Action Recognition: A Review on Temporal Modeling

Elham Shabaninia, Hossein Nezamabadi–pour|arXiv (Cornell University)|Dec 29, 2022
Human Pose and Action Recognition被引用 10
一句话总结

本文综述了基于Transformer的视频动作识别时序建模方法,重点介绍了通过自注意力机制捕捉视频帧间长距离依赖关系的方法。文章将方法分为基于运动、3D卷积神经网络(3D CNN)、循环神经网络(RNN)、Transformer以及混合方法五类,强调了Transformer通过可学习的注意力权重和位置编码在建模全局时序动态方面的优越性。

ABSTRACT

In vision-based action recognition, spatio-temporal features from different modalities are used for recognizing activities. Temporal modeling is a long challenge of action recognition. However, there are limited methods such as pre-computed motion features, three-dimensional (3D) filters, and recurrent neural networks (RNN) for modeling motion information in deep-based approaches. Recently, transformers success in modeling long-range dependencies in natural language processing (NLP) tasks has gotten great attention from other domains; including speech, image, and video, to rely entirely on self-attention without using sequence-aligned RNNs or convolutions. Although the application of transformers to action recognition is relatively new, the amount of research proposed on this topic within the last few years is astounding. This paper especially reviews recent progress in deep learning methods for modeling temporal variations. It focuses on action recognition methods that use transformers for temporal modeling, discussing their main features, used modalities, and identifying opportunities and challenges for future research.

研究动机与目标

  • 综述近期用于建模视频动作识别中时序变化的深度学习方法。
  • 将现有方法分类为五类:基于运动的特征、3D卷积神经网络(3D CNN)、循环神经网络(RNN)、Transformer以及混合模型。
  • 分析在基于Transformer的框架中,不同视觉模态(RGB、深度、骨骼)的表现。
  • 识别在使用Transformer进行时序建模方面存在的开放性挑战与未来研究方向。
  • 全面概述自注意力机制如何实现全局上下文学习,相较于卷积神经网络(CNN)和RNN中的局部操作的优势。

提出的方法

  • 本文采用系统性综述方法,分析在动作识别中应用的基于Transformer的架构。
  • 研究了自注意力机制,其由查询(queries)、键(keys)和值(values)定义,采用缩放点积注意力:$ Z = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V $。
  • 多头注意力机制并行计算多个注意力头,以提升在不同子空间中的表征学习能力。
  • 在输入序列中添加位置编码,以保留序列顺序,因为Transformer缺乏循环或卷积归纳偏置。
  • 回顾了Transformer的编码器-解码器结构,每个子层后均应用残差连接和层归一化。
  • 将Transformer与传统方法(如3D卷积和RNN)进行比较,强调注意力机制在建模长距离依赖关系方面的优势。

实验结果

研究问题

  • RQ1与3D卷积神经网络和RNN相比,Transformer在视频动作识别中如何提升时序建模性能?
  • RQ2Transformer模型的关键架构组件是什么,使其能够有效学习长距离时序依赖关系?
  • RQ3当与基于Transformer的时序建模结合时,不同视觉模态(RGB、深度、骨骼)的表现如何?
  • RQ4在将Transformer应用于动作识别任务时,其主要局限性和挑战是什么?
  • RQ5结合Transformer与其他架构(如CNN或RNN)的混合模型如何提升时序建模性能?

主要发现

  • 由于其全局注意力机制,Transformer在建模长距离时序依赖关系方面优于RNN和3D CNN。
  • 自注意力机制能够对所有帧实现动态、上下文感知的特征加权,而卷积网络的接受感受野是固定的。
  • 多头注意力机制使模型能够关注序列的多个子空间,从而提升特征表征能力和泛化性能。
  • 在缺乏循环或卷积归纳偏置的情况下,位置编码对于保持序列顺序至关重要。
  • 通过结合CNN或RNN,Transformer的混合模型在性能上有所提升,能够同时利用局部空间特征和长距离时序上下文。
  • 尽管取得了成功,Transformer仍需要大规模标注数据集,且计算成本高昂,给实时部署带来挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。