Skip to main content
QUICK REVIEW

[论文解读] TubeR: Tube-Transformer for Action Detection.

Jiaojiao Zhao, Xinyu Li|arXiv (Cornell University)|Apr 2, 2021
Human Pose and Action Recognition参考文献 40被引用 11
一句话总结

TubeR 是一种基于 Transformer 的新型架构,用于端到端动作检测,能够学习灵活的、可变长度的动作管路(action tubes),而无需手工设计的管路提议。通过可学习的管路查询和动作管路嵌入来建模时间与空间范围,它在 UCF101-24 和 J-HMDB 上实现了最先进性能,在 AVA 上也取得了具有竞争力的结果,展现出在长时视频理解方面的强大潜力。

ABSTRACT

In this paper, we propose TubeR: the first transformer based network for end-to-end action detection, with an encoder and decoder optimized for modeling action tubes with variable lengths and aspect ratios. TubeR does not rely on hand-designed tube structures, automatically links predicted action boxes over time and learns a set of tube queries related to actions. By learning action tube embeddings, TubeR predicts more precise action tubes with flexible spatial and temporal extents. Our experiments demonstrate TubeR achieves state-of-the-art among single-stream methods on UCF101-24 and J-HMDB. TubeR outperforms existing one-model methods on AVA and is even competitive with the two-model methods. Moreover, we observe TubeR has the potential on tracking actors with different actions, which will foster future research in long-range video understanding.

研究动机与目标

  • 开发一种单流端到端动作检测框架,消除对人工设计的管路提议的依赖。
  • 通过可学习的注意力机制架构,对具有可变长度和宽高比的动作管路进行建模。
  • 通过 Transformer 编码器-解码器结构学习动作管路嵌入,提升空间与时间定位精度。
  • 通过学习可学习的管路查询,实现动作预测在帧间的自动时间对齐。
  • 探索该模型在长时视频理解及多动作跟踪方面的潜力。

提出的方法

  • TubeR 采用基于 Transformer 的编码器-解码器架构,用于处理视频片段并端到端预测动作管路。
  • 它引入可学习的管路查询,通过关注视频特征生成具有可变空间与时间范围的动作管路预测。
  • 模型学习动作管路嵌入,以编码空间边界框和时间持续时长,从而实现灵活的管路生成。
  • 解码器通过多头自注意力和交叉注意力机制,关注编码器特征与管路查询,以优化预测结果。
  • TubeR 通过直接从视频 token 预测动作管路,实现空间与时间定位的联合优化,无需后处理。
  • 它使用集合预测头输出一组动作管路预测,支持可变长度输出,且无需锚框先验。

实验结果

研究问题

  • RQ1基于 Transformer 的架构是否能够在无需手工设计提议的情况下,学习生成具有可变长度和宽高比的动作管路?
  • RQ2与两阶段或基于锚框的方法相比,端到端学习管路查询与嵌入是否能显著提升定位精度?
  • RQ3单流 Transformer 模型在标准动作检测基准上能否实现最先进性能?
  • RQ4该模型是否能泛化到长时视频理解以及单个演员执行多个动作的跟踪任务?
  • RQ5所学习的管路查询是否能够实现帧间动作预测的自动时间对齐?

主要发现

  • TubeR 在 UCF101-24 和 J-HMDB 上作为单流方法实现了最先进性能,表现出更优的定位与检测精度。
  • 在 AVA 基准上,TubeR 超过了现有单模型方法,并与双模型集成方法性能相当。
  • 通过端到端训练,模型能够学习生成具有灵活空间与时间范围的动作管路,且无需手工构建管路结构。
  • TubeR 展现出在长视频序列中追踪执行多个动作的演员方面的强大潜力,表明其在长时视频理解方面具有前景。
  • 使用可学习的管路查询可实现动作预测在时间上的自动连接,提升时间一致性。
  • 该架构的注意力机制能有效建模长距离依赖,支持在多种视频时长下实现鲁棒的动作管路预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。