Skip to main content
QUICK REVIEW

[论文解读] PTSEFormer: Progressive Temporal-Spatial Enhanced TransFormer Towards Video Object Detection

Han Wang, Jun Tang|arXiv (Cornell University)|Sep 6, 2022
Advanced Neural Network Applications被引用 8
一句话总结

PTSEFormer 提出了一种用于视频目标检测的渐进式时空增强 Transformer 框架,通过引入时间特征聚合模块(TFAM)实现时间特征聚合,并通过空间过渡感知模块(STAM)实现空间过渡感知,从而提升特征表示能力。在 ImageNet VID 数据集上达到 88.1% 的 mAP,相较于之前的端到端方法提升了 4.9% 的绝对 mAP,使用 ResNet-101 主干网络。

ABSTRACT

Recent years have witnessed a trend of applying context frames to boost the performance of object detection as video object detection. Existing methods usually aggregate features at one stroke to enhance the feature. These methods, however, usually lack spatial information from neighboring frames and suffer from insufficient feature aggregation. To address the issues, we perform a progressive way to introduce both temporal information and spatial information for an integrated enhancement. The temporal information is introduced by the temporal feature aggregation model (TFAM), by conducting an attention mechanism between the context frames and the target frame (i.e., the frame to be detected). Meanwhile, we employ a Spatial Transition Awareness Model (STAM) to convey the location transition information between each context frame and target frame. Built upon a transformer-based detector DETR, our PTSEFormer also follows an end-to-end fashion to avoid heavy post-processing procedures while achieving 88.1% mAP on the ImageNet VID dataset. Codes are available at https://github.com/Hon-Wong/PTSEFormer.

研究动机与目标

  • 为解决现有视频目标检测方法中单次特征聚合的局限性,这些方法未能充分利用时间与空间上下文。
  • 通过利用帧级的空间与时间关系,提升对运动模糊、遮挡和形变等图像退化情况的检测鲁棒性。
  • 通过基于 DETR 的架构维持端到端训练范式,消除对后处理的依赖。
  • 通过从上下文帧回归查询位置而非依赖固定学习的查询,提升对象查询的学习能力。

提出的方法

  • 提出时间特征聚合模块(TFAM),在目标帧与上下文帧之间应用交叉注意力机制,实现不同目标姿态下的时间特征聚合。
  • 提出空间过渡感知模块(STAM),用于建模目标帧与每个上下文帧之间的对象位置过渡,提升特征表示中的空间一致性。
  • 设计门控相关模块,平衡 Transformer 解码器中的残差连接,缓解特征融合过程中的不平衡问题。
  • 开发查询整合模块(QAM),从上下文帧回归对象查询,实现动态、上下文感知的查询初始化,而非依赖固定查询。
  • 基于 DETR 的单阶段检测器构建整个框架,维持端到端训练,避免 NMS 或 Tublet-Linking 等复杂后处理。
  • 采用渐进式特征增强策略,按顺序集成时间与空间信息,提升特征判别能力。

实验结果

研究问题

  • RQ1渐进式集成时间与空间信息是否能提升视频目标检测中的特征表示?
  • RQ2建模帧间对象位置过渡如何增强在遮挡与形变情况下的检测鲁棒性?
  • RQ3与固定查询方法相比,采用动态查询学习的端到端训练在视频检测中能多大程度上实现性能超越?
  • RQ4专用的门控相关模块是否能提升 Transformer 解码器中视频检测的特征融合稳定性?
  • RQ5统一的渐进式增强策略是否能优于单次聚合,在时间与空间特征融合中均表现更优?

主要发现

  • PTSEFormer 在 ImageNet VID 数据集上达到 88.1% 的 mAP,相较于之前端到端的 SOTA 方法提升了 4.9% 的绝对 mAP。
  • 当使用 ResNet-101 主干网络时,该方法在无后处理条件下相比其带后处理的变体提升了 3.3% 的 mAP,证明了端到端设计的有效性。
  • 可视化结果表明,时间记忆(Tt)增强了前景-背景分离能力,最终增强记忆(Rt)提升了目标定位的置信度。
  • 该模型在处理遮挡与形变方面表现出更优的鲁棒性:例如,在部分遮挡面部的情况下,能正确识别一只仓鼠,而单帧基线模型则将其误分类为猫。
  • STAM 模块通过利用空间过渡线索,能够更好地区分重叠实例,如两只鲸鱼,从而提升紧密排列物体的检测能力。
  • 消融实验表明,TFAM 与 STAM 均对性能提升有显著贡献,且渐进式融合策略优于单步聚合方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。