Skip to main content
QUICK REVIEW

[论文解读] Two-Stream Transformer Architecture for Long Video Understanding

Edward B. Fish, Jon Weinbren|arXiv (Cornell University)|Aug 2, 2022
Human Pose and Action Recognition被引用 4
一句话总结

该论文提出 STAN,一种双流 Transformer 架构,通过结合来自预训练 CNN 的空间图像特征与时间上下文特征,实现高效、数据高效且内存高效的长视频理解。通过在双流 Transformer 设置中引入卷积神经网络的归纳偏置,STAN 可在单张 GPU 上对长达两分钟的视频进行分类,并在长视频任务中达到最先进性能。

ABSTRACT

Pure vision transformer architectures are highly effective for short video classification and action recognition tasks. However, due to the quadratic complexity of self attention and lack of inductive bias, transformers are resource intensive and suffer from data inefficiencies. Long form video understanding tasks amplify data and memory efficiency problems in transformers making current approaches unfeasible to implement on data or memory restricted domains. This paper introduces an efficient Spatio-Temporal Attention Network (STAN) which uses a two-stream transformer architecture to model dependencies between static image features and temporal contextual features. Our proposed approach can classify videos up to two minutes in length on a single GPU, is data efficient, and achieves SOTA performance on several long video understanding tasks.

研究动机与目标

  • 解决纯视觉 Transformer 在长视频理解(LVU)任务中的数据与内存低效问题。
  • 克服标准 Transformer 在长视频中自注意力机制的二次方复杂度以及缺乏归纳偏置的问题。
  • 通过将卷积神经网络(CNN)的归纳偏置引入 Transformer 架构,提升数据效率。
  • 实现在资源受限硬件(如单张 GPU)上的长视频分类模型端到端训练与推理。
  • 在保持计算可行性的同时,在长视频理解基准上实现最先进性能。

提出的方法

  • 采用双流架构:一路通过预训练的 2D CNN 处理由单帧提取的空间图像特征,另一路通过 1D 时间编码器处理时间上下文特征。
  • 从两路分别提取固定大小的 token:空间 token 来自图像级特征,时间 token 来自帧序列的表示。
  • 将融合后的空间与时间 token 输入共享的 Transformer 编码器,并引入可学习的分类 token 以建模长距离依赖关系。
  • 应用位置嵌入以在 Transformer 输入中保持空间与时间顺序信息。
  • 使用标准优化与数据增强策略,通过交叉熵损失端到端训练整个网络以进行视频分类。
  • 使用知识蒸馏与消融研究验证双流设计与特征融合策略的有效性。

实验结果

研究问题

  • RQ1基于 CNN 的特征提取的双流 Transformer 架构能否在长视频理解中提升数据与内存效率?
  • RQ2将 CNN 的归纳偏置引入视觉 Transformer 对长视频任务的性能与样本效率有何影响?
  • RQ3基于 Transformer 的模型在仅使用单张 GPU 的情况下,能在多大程度上对长达两分钟的视频进行分类?
  • RQ4在融合前分别建模空间与时间特征,是否比联合 3D token 化在长视频分类中表现更优?
  • RQ5在长视频基准上,所提方法在准确率、数据效率与计算开销方面与最先进方法相比如何?

主要发现

  • STAN 在 MMX-Trailer-20 数据集上达到最先进性能,加权 F1 得分为 0.65,mAP 为 0.64,优于所有基线模型,包括 ResNet、I3D 和 SqueezeNet。
  • 在惊悚片类别中,STAN 相较于次优方法准确率提升 +58%,展现出强大的长期时间推理能力。
  • 使用 STAN-Large 模型,在包含 6047 个样本的完整数据集上,mAP 达到 0.7506,显著优于蒸馏模型(0.6005 mAP)与消融变体。
  • 仅使用 2000 个训练样本时,STAN-Small 模型 mAP 达到 0.6401,展现出在低数据场景下的强大数据效率与泛化能力。
  • 类别激活图表明,模型学习到了有意义的空间与时间注意力机制,聚焦于家庭视频中的面部等关键视觉线索,以及恐怖片中具有表现力的面部。
  • 消融研究显示,带有反向传播的时间流达到最高 mAP(0.6221),表明时间建模对性能至关重要;而无反向传播的空间流表现较差(0.4024),凸显了联合优化的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。