Skip to main content
QUICK REVIEW

[论文解读] MOTRv2: Bootstrapping End-to-End Multi-Object Tracking by Pretrained Object Detectors

Yuang Zhang, Tiancai Wang|arXiv (Cornell University)|Nov 17, 2022
Human Pose and Action Recognition被引用 9
一句话总结

MOTRv2 提出了一种简单而有效的框架,通过引入预训练目标检测器(YOLOX)来提升端到端多目标跟踪的检测性能,从而增强整体跟踪效果。通过将检测器生成的提议作为 MOTR 的候选查询,该方法将检测与关联解耦,显著提升了精度——在 DanceTrack 上达到 SOTA(73.4% HOTA),在 BDD100K 上达到 SOTA(43.6% mMOTA),同时保持了端到端学习的特性。

ABSTRACT

In this paper, we propose MOTRv2, a simple yet effective pipeline to bootstrap end-to-end multi-object tracking with a pretrained object detector. Existing end-to-end methods, MOTR and TrackFormer are inferior to their tracking-by-detection counterparts mainly due to their poor detection performance. We aim to improve MOTR by elegantly incorporating an extra object detector. We first adopt the anchor formulation of queries and then use an extra object detector to generate proposals as anchors, providing detection prior to MOTR. The simple modification greatly eases the conflict between joint learning detection and association tasks in MOTR. MOTRv2 keeps the query propogation feature and scales well on large-scale benchmarks. MOTRv2 ranks the 1st place (73.4% HOTA on DanceTrack) in the 1st Multiple People Tracking in Group Dance Challenge. Moreover, MOTRv2 reaches state-of-the-art performance on the BDD100K dataset. We hope this simple and effective pipeline can provide some new insights to the end-to-end MOT community. Code is available at \url{https://github.com/megvii-research/MOTRv2}.

研究动机与目标

  • 解决如 MOTR 等端到端 MOT 框架中检测性能较差的问题,该问题限制了整体跟踪精度。
  • 克服共享 Transformer 解码器中检测与关联学习之间的固有冲突。
  • 利用来自预训练检测器(YOLOX)的高质量目标检测先验,提升端到端跟踪中的检测可靠性。
  • 在保持端到端学习的同时,通过外部监督增强检测性能,避免完全重新训练的需要。
  • 通过模块化、可扩展的方式整合检测与跟踪,为未来端到端 MOT 研究建立一个强大而简洁的基线。

提出的方法

  • 将 MOTR 检测查询中的可学习位置嵌入替换为源自 YOLOX 生成目标提议的正弦-余弦位置编码,实现基于锚点的查询初始化。
  • 使用 YOLOX 提议作为提议查询,以初始化检测查询,提供强定位先验,减轻检测头的优化难度。
  • 保留 MOTR 的查询传播机制用于跟踪,确保端到端可微分性与时序一致性。
  • 在训练期间应用轨迹查询对齐:通过匈牙利匹配将 MOTR 预测与 YOLOX 提议对齐,并将轨迹查询锚点对齐到 YOLOX 框体,以减少定位漂移。
  • 对未匹配的 MOTR 预测实施预测移除,以消除误报,提升检测与关联的准确性。
  • 引入查询去噪以稳定训练并提升检测性能,噪声尺度在 DanceTrack 验证集上进行调优。

实验结果

研究问题

  • RQ1将预训练目标检测器集成是否能显著提升端到端多目标跟踪中的检测性能?
  • RQ2使用检测器生成的提议作为查询锚点,是否能缓解联合学习框架中检测与关联之间的冲突?
  • RQ3当引入高质量检测先验时,端到端 MOT 模型是否能在不牺牲端到端训练的前提下实现 SOTA 性能?
  • RQ4轨迹查询对齐在复杂跟踪场景中,对减少定位误差与误报的效率如何?
  • RQ5查询去噪在 MOTRv2 框架中对检测与关联指标的影响是什么?

主要发现

  • 在 DanceTrack 数据集上,MOTRv2 达到 73.4% HOTA,相比之前 SOTA 方法 OC-SORT 在 HOTA 上提升 14.8 个百分点,在 AssA 上提升 18.8 个百分点。
  • 在大规模 BDD100K 数据集上,MOTRv2 达到 43.6% mMOTA,较之前 SOTA 方法 Unicorn 提升 2.4 个百分点。
  • 在 MOT17 上,MOTRv2 在完整轨迹查询对齐下达到 86.8% MOTA 和 79.7% IDF1,显著优于基线 MOTR 及其他端到端方法。
  • 轨迹查询对齐——尤其是将锚点对齐到 YOLOX 提议——相比基线 MOTR,使 MOTA 提升 8.4%,IDF1 提升 3.9%。
  • 在锚点对齐基础上移除未匹配的 MOTR 预测,可使 MOTA 提升 2.0%,有效减少误报。
  • 查询去噪使 DetA 提升 2.1%,HOTA 提升 0.8%,证明其在稳定训练与提升检测质量方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。