[论文解读] Contrastive Learning for Multi-Object Tracking with Transformers
本文提出 ContrasTR,一种轻量级多目标跟踪方法,通过实例级对比学习将类似 DETR 的目标检测器转化为端到端跟踪器。通过引入对比损失、改进的帧采样策略以及投影头,该方法在 BDD100K 上实现 +2.6 mMOTA 的 SOTA 性能,且在 MOT17 上表现与 SOTA 相当,同时保持检测质量并避免复杂的架构扩展。
The DEtection TRansformer (DETR) opened new possibilities for object detection by modeling it as a translation task: converting image features into object-level representations. Previous works typically add expensive modules to DETR to perform Multi-Object Tracking (MOT), resulting in more complicated architectures. We instead show how DETR can be turned into a MOT model by employing an instance-level contrastive loss, a revised sampling strategy and a lightweight assignment method. Our training scheme learns object appearances while preserving detection capabilities and with little overhead. Its performance surpasses the previous state-of-the-art by +2.6 mMOTA on the challenging BDD100K dataset and is comparable to existing transformer-based methods on the MOT17 dataset.
研究动机与目标
- 开发一种简单而有效的方法,将基于 DETR 的目标检测器适配为多目标跟踪模型,而无需添加复杂组件。
- 通过实例级对比学习学习判别性嵌入,提升跨帧的目标重识别能力。
- 在仅包含检测标注的数据集上实现可扩展的预训练,以提升跟踪性能,而无需依赖跟踪标注。
- 证明通过统一的对象表征可实现联合检测与跟踪,从而降低架构复杂度。
- 表明对非连续帧进行精心采样可增强在运动与外观变化下的鲁棒性。
提出的方法
- 该方法采用实例级对比损失,训练模型以区分正样本对(跨帧相同目标)与负样本对(不同目标)。
- 采用改进的采样策略,从多段视频中选取非连续帧,以提升训练批次中外观与场景的多样性。
- 引入一个轻量级前馈网络(FFN)投影头,从 DETR 的对象表征中生成跟踪嵌入,实现跟踪与检测头的解耦。
- 在检测数据集上使用对比学习进行预训练,无需跟踪 ID,利用大规模检测数据提升嵌入空间质量。
- 训练采用多任务目标,结合检测损失与对比损失,并引入可学习的权重系数调节对比项的贡献。
- 推理阶段使用二分图匹配,基于学习到的嵌入将预测结果分配给对应轨迹。
实验结果
研究问题
- RQ1能否在极少架构修改的前提下,有效将基于 DETR 的检测器适配为多目标跟踪系统?
- RQ2实例级对比学习在复杂跟踪场景下如何提升目标重识别能力?
- RQ3何种采样策略能最大程度提升对运动、遮挡和外观变化的鲁棒性?
- RQ4能否在仅包含检测标注的数据集上进行预训练,以提升跟踪性能而无需跟踪标注?
- RQ5哪些组件对学习联合检测与关联特征至关重要,它们之间如何协同作用?
主要发现
- ContrasTR 在具有挑战性的 BDD100K 数据集上相较之前 SOTA 实现 +2.6 mMOTA 的性能提升,达到 35.1 mMOTA。
- 在 MOT17 基准上,ContrasTR 表现与现有基于 Transformer 的方法相当,展现出强大的泛化能力。
- 消融实验表明,对比损失、投影头和预训练均至关重要:移除任一组件均导致 mHOTA 下降超过 3 个百分点。
- 最佳性能在 Nv=4(4 个视频)、Nf=10(每视频 10 帧)设置下取得,BDD100K 上实现 36.2 mHOTA 和 33.6 mMOTA。
- 对比损失权重 λ_contr = 0.5 时性能最优,能有效平衡检测与跟踪目标。
- 在检测数据上通过对比学习进行预训练,即使在跟踪数据集上微调,也能提升跟踪指标,表明具有强大的迁移能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。