Skip to main content
QUICK REVIEW

[论文解读] MOTR: End-to-End Multiple-Object Tracking with Transformer

Fangao Zeng, Bin Dong|arXiv (Cornell University)|May 7, 2021
Video Surveillance and Tracking Methods参考文献 54被引用 16
一句话总结

MOTR 提出了一种基于 Transformer 架构的端到端多目标跟踪框架,采用可学习的‘轨迹查询’机制,在帧间迭代更新以建模目标轨迹。通过引入轨迹片段感知的标签分配策略、用于动态轨迹管理的进入与退出机制,以及集体平均损失和时间聚合网络等时间建模组件,MOTR 在 DanceTrack 上的 HOTA 指标上超越 ByteTrack 6.5%,并在 MOT17 上展现出显著性能提升,达到最先进水平。

ABSTRACT

Temporal modeling of objects is a key challenge in multiple object tracking (MOT). Existing methods track by associating detections through motion-based and appearance-based similarity heuristics. The post-processing nature of association prevents end-to-end exploitation of temporal variations in video sequence. In this paper, we propose MOTR, which extends DETR and introduces track query to model the tracked instances in the entire video. Track query is transferred and updated frame-by-frame to perform iterative prediction over time. We propose tracklet-aware label assignment to train track queries and newborn object queries. We further propose temporal aggregation network and collective average loss to enhance temporal relation modeling. Experimental results on DanceTrack show that MOTR significantly outperforms state-of-the-art method, ByteTrack by 6.5% on HOTA metric. On MOT17, MOTR outperforms our concurrent works, TrackFormer and TransTrack, on association performance. MOTR can serve as a stronger baseline for future research on temporal modeling and Transformer-based trackers. Code is available at https://github.com/megvii-research/MOTR.

研究动机与目标

  • 解决现有 MOT 方法中后处理关联的局限性,实现对象轨迹的完全端到端学习。
  • 通过跨视频帧的迭代查询更新,联合建模外观和运动的时间变化。
  • 通过在 Transformer 框架内直接学习轨迹关联,消除对启发式匹配(如 IoU 或 Re-ID)的依赖。
  • 通过增强的时间建模提升在遮挡和身份切换等复杂序列上的泛化能力。

提出的方法

  • 在 DETR 的基础上引入‘轨迹查询’,作为对象轨迹的隐状态,并通过帧间自注意力和交叉注意力机制进行更新。
  • 采用轨迹片段感知的标签分配(TALA),利用具有相同身份的真值边界框序列来监督轨迹查询。
  • 引入进入与退出机制,实现对轨迹查询的动态管理:通过插入添加新对象,通过移除终止已结束的轨迹。
  • 提出时间聚合网络(TAN),使轨迹查询能够通过键-查询机制关注自身的历史状态,从而提升长程建模能力。
  • 引入集体平均损失(CAL),在完整视频片段上进行训练,通过聚合多帧损失提升时间一致性。
  • 在训练过程中以概率 $p_{drop}$ 和 $p_{insert}$ 对轨迹查询进行擦除与插入,以模拟对象进入与退出的场景。

实验结果

研究问题

  • RQ1基于 Transformer 的端到端框架能否在无需后处理关联的情况下,联合建模多目标跟踪中的外观与运动变化?
  • RQ2如何在帧间有效更新与分配轨迹查询,以完整建模对象轨迹?
  • RQ3在长程时间依赖和遮挡场景下,哪种训练策略最有效以提升泛化能力?
  • RQ4与逐帧训练相比,通过 CAL 在视频片段上进行联合优化在多大程度上提升了跟踪鲁棒性?
  • RQ5查询级别的机制(如进入/退出、擦除/插入)在多大程度上改善了对新生与终止对象的跟踪?

主要发现

  • 在 DanceTrack 数据集上,MOTR 在 HOTA 指标上比最先进方法 ByteTrack 提升 6.5%,在 AssA 指标上提升 8.1%。
  • 在 MOT17 上,MOTR 的关联性能优于同期方法如 TrackFormer 和 TransTrack。
  • 将 TAN 集成到基线模型中,使 MOTA 提升 7.8%,IDF1 提升 13.6%,证明其在建模时间动态方面的有效性。
  • 使用长度为 5 的视频片段进行集体平均损失(CAL)训练,使 MOTA 提升 8.3%,IDF1 提升 7.1%,显著改善了对遮挡和困难样本的处理能力。
  • 最优训练超参数为 $p_{drop} = 0.1$(查询擦除)和 $p_{insert} = 0.3$(查询插入),在最大化 MOTA 的同时保持较高的 IDF1。
  • 训练期间采样间隔具有显著影响:间隔超过 10 会降低性能,而间隔为 2–10 时可将 IDS 从 209 降低至 155,显著提升跟踪性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。