[论文解读] MOTRv3: Release-Fetch Supervision for End-to-End Multi-Object Tracking
MOTRv3 提出了一种新颖的释放-获取监督(RFS)策略,以解决端到端多目标跟踪中检测与关联之间的优化冲突,实现在无需外部检测器的情况下提升检测监督。通过早期释放标签以供检测查询使用,并逐步获取标签用于关联,结合伪标签蒸馏和轨迹组去噪,MOTRv3 在 MOT17 和 DanceTrack 基准上实现了最先进性能,同时保持了完整的端到端训练。
Although end-to-end multi-object trackers like MOTR enjoy the merits of simplicity, they suffer from the conflict between detection and association seriously, resulting in unsatisfactory convergence dynamics. While MOTRv2 partly addresses this problem, it demands an additional detection network for assistance. In this work, we serve as the first to reveal that this conflict arises from the unfair label assignment between detect queries and track queries during training, where these detect queries recognize targets and track queries associate them. Based on this observation, we propose MOTRv3, which balances the label assignment process using the developed release-fetch supervision strategy. In this strategy, labels are first released for detection and gradually fetched back for association. Besides, another two strategies named pseudo label distillation and track group denoising are designed to further improve the supervision for detection and association. Without the assistance of an extra detection network during inference, MOTRv3 achieves impressive performance across diverse benchmarks, e.g., MOT17, DanceTrack.
研究动机与目标
- 识别 MOTR 等端到端多目标跟踪框架中检测性能不佳的根本原因。
- 解决检测与关联之间因优化冲突而导致收敛困难的问题。
- 在推理阶段不依赖外部目标检测器的前提下,提升检测与关联的监督能力。
- 在保持端到端训练的同时,显著提升多个基准上的跟踪精度。
提出的方法
- 提出释放-获取监督(RFS),其中框标签首先释放给早期解码器层中的检测查询进行训练,随后在后续层中被获取以用于轨迹查询的关联。
- 引入伪标签蒸馏(PLD),利用预训练检测器(如 YOLOX 或 Sparse R-CNN)为检测查询生成多样化辅助监督。
- 设计轨迹组去噪(TGD),将轨迹查询分组,并在训练期间向其参考点注入随机噪声,以稳定关联学习。
- 保持 MOTR 原始的端到端 Transformer 架构,但修改标签分配机制,以平衡检测头与关联头之间的监督。
- 在前五个解码器层中应用 RFS,仅在最后一层保留标准的一对一匹配机制。
- 将 RFS、PLD 和 TGD 整合为统一的训练流程,从而同时提升检测精度与关联鲁棒性。
实验结果
研究问题
- RQ1为何像 MOTR 这类端到端多目标跟踪方法尽管架构优雅,却仍存在检测性能不佳的问题?
- RQ2检测查询与轨迹查询之间不公平的标签分配如何导致多目标跟踪中的优化冲突?
- RQ3是否可以通过重构监督方式,在不引入外部检测器或破坏端到端训练的前提下改善检测性能?
- RQ4通过伪标签提供的辅助监督以及在轨迹查询中引入噪声,能在多大程度上提升跟踪性能?
- RQ5与非端到端基线相比,所提方法在骨干网络架构变化时的可扩展性如何?
主要发现
- MOTR 中检测性能下降的主要原因是标签分配不公平:仅第一帧的真实框(自由 GT)用于训练检测查询,而后续帧的标签被锁定在轨迹查询上。
- RFS 显著提升了检测性能,使检测查询能够在早期解码器层中基于所有标注框进行训练,从而实现更好的收敛。
- 在 MOT17 测试集上,MOTRv3 达到 72.1% 的 HOTA,超越 MOTRv2,并在无需外部检测器的端到端多目标跟踪中创下新的 SOTA 记录。
- 采用每组 4 个查询并注入噪声的轨迹组去噪(TGD)显著提升了关联稳定性,在 DanceTrack 上将 HOTA 提升最高达 1.2 个百分点。
- 模型缩放实验表明,MOTRv3 持续从更大骨干网络(如 ConvNeXt-Base)中获益,而由于其非端到端特性,MOTRv2 在使用更大骨干网络时性能反而下降。
- 伪标签蒸馏(PLD)提供了有效的辅助监督,提升了检测的泛化能力,并减少了对稀疏标签的过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。