Skip to main content
QUICK REVIEW

[论文解读] Long Short-Term Transformer for Online Action Detection

Mingze Xu, Yuanjun Xiong|arXiv (Cornell University)|Jul 7, 2021
Human Pose and Action Recognition参考文献 74被引用 11
一句话总结

LSTR 提出了一种基于 Transformer 的新型架构,用于在线动作检测,通过显式分离长时记忆与短时记忆,实现对长达 8 分钟的视频序列的高时间粒度建模。通过将长时历史压缩为固定长度的潜在表征,并在处理细粒度短时上下文时通过交叉注意力机制关注该表征,LSTR 在 THUMOS’14、TVSeries 和 HACS Segment 基准上实现了最先进性能,同时提升了效率并减少了对启发式方法的依赖。

ABSTRACT

We present Long Short-term TRansformer (LSTR), a temporal modeling algorithm for online action detection, which employs a long- and short-term memory mechanism to model prolonged sequence data. It consists of an LSTR encoder that dynamically leverages coarse-scale historical information from an extended temporal window (e.g., 2048 frames spanning of up to 8 minutes), together with an LSTR decoder that focuses on a short time window (e.g., 32 frames spanning 8 seconds) to model the fine-scale characteristics of the data. Compared to prior work, LSTR provides an effective and efficient method to model long videos with fewer heuristics, which is validated by extensive empirical analysis. LSTR achieves state-of-the-art performance on three standard online action detection benchmarks, THUMOS'14, TVSeries, and HACS Segment. Code has been made available at: https://xumingze0308.github.io/projects/lstr

研究动机与目标

  • 为解决在在线动作检测中建模长时间视频序列(长达 8 分钟)的挑战,其中未来帧不可用。
  • 克服循环神经网络模型需要时间反向传播且难以处理长距离依赖的局限性。
  • 通过显式分离长时历史上下文与短时细粒度帧级动态,改进时间建模。
  • 开发一种高效、端到端的架构,避免使用启发式下采样或池化操作,同时保持高精度。

提出的方法

  • LSTR 采用编码器-解码器 Transformer 架构,包含两条独立的记忆流:长时记忆(最多 2048 帧)和短时记忆(32 帧)。
  • LSTR 编码器通过两阶段记忆压缩将长时历史压缩为固定长度的潜在表征,实现高效的长上下文建模。
  • LSTR 解码器在短时帧与编码后的长时记忆之间执行自注意力和交叉注意力,以优化预测结果。
  • 模型使用因果注意力机制,确保仅使用过去和当前信息,满足在线推理约束。
  • 通过直接关注长时记忆中的任意帧,避免使用循环单元,从而消除对时间反向传播的需求。
  • 该架构可通过添加带位置嵌入和方向掩码的未来标记,扩展至动作预测任务。

实验结果

研究问题

  • RQ1自注意力机制是否能在无循环单元的情况下,有效建模长达 8 分钟的视频序列,用于在线动作检测?
  • RQ2将长时记忆与短时记忆显式分离,相较于统一建模过去上下文,能否显著提升性能?
  • RQ3在压缩长时记忆的同时,LSTR 能在多大程度上保持细粒度的时间分辨率?
  • RQ4LSTR 能否在具有不同视频长度和动作特征的多样化数据集上实现良好泛化?
  • RQ5在准确率和计算效率方面,LSTR 与先前最先进方法相比表现如何?

主要发现

  • LSTR 在三个标准基准测试上实现了最先进性能:THUMOS’14、TVSeries 和 HACS Segment。
  • 在 THUMOS’14 上,LSTR 在 'HammerThrow' 动作上实现了 92.8% 的平均平均精度(mAP),为所有评估方法中的最高值。
  • LSTR 在长时长、多阶段动作(如 'PoleVault' 和 'LongJump')上表现强劲,分别达到 89.7% 和 86.9% 的 mAP。
  • 模型在运动量小或可见度低的动作上精度有所下降,如 'Billiards'(39.8% mAP)和 'CricketShot'(38.6% mAP),表明对视觉细微差异较为敏感。
  • 消融实验表明,长时与短时记忆的分离显著提升了建模效率与表征质量。
  • 将 LSTR 扩展至未来 2 秒的动作预测任务,获得具有竞争力的结果,验证了其在相关任务中的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。