Skip to main content
QUICK REVIEW

[论文解读] Contrastive Learning for Multi-Object Tracking with Transformers

Pierre-François De Plaen, Nicola Marinello|arXiv (Cornell University)|Nov 14, 2023
Video Surveillance and Tracking Methods被引用 4
一句话总结

本文提出 ContrasTR,一种轻量级多目标跟踪方法,通过实例级对比学习将类似 DETR 的目标检测器转化为端到端跟踪器。通过引入对比损失、改进的帧采样策略以及投影头,该方法在 BDD100K 上实现 +2.6 mMOTA 的 SOTA 性能,且在 MOT17 上表现与 SOTA 相当,同时保持检测质量并避免复杂的架构扩展。

ABSTRACT

The DEtection TRansformer (DETR) opened new possibilities for object detection by modeling it as a translation task: converting image features into object-level representations. Previous works typically add expensive modules to DETR to perform Multi-Object Tracking (MOT), resulting in more complicated architectures. We instead show how DETR can be turned into a MOT model by employing an instance-level contrastive loss, a revised sampling strategy and a lightweight assignment method. Our training scheme learns object appearances while preserving detection capabilities and with little overhead. Its performance surpasses the previous state-of-the-art by +2.6 mMOTA on the challenging BDD100K dataset and is comparable to existing transformer-based methods on the MOT17 dataset.

研究动机与目标

  • 开发一种简单而有效的方法,将基于 DETR 的目标检测器适配为多目标跟踪模型,而无需添加复杂组件。
  • 通过实例级对比学习学习判别性嵌入,提升跨帧的目标重识别能力。
  • 在仅包含检测标注的数据集上实现可扩展的预训练,以提升跟踪性能,而无需依赖跟踪标注。
  • 证明通过统一的对象表征可实现联合检测与跟踪,从而降低架构复杂度。
  • 表明对非连续帧进行精心采样可增强在运动与外观变化下的鲁棒性。

提出的方法

  • 该方法采用实例级对比损失,训练模型以区分正样本对(跨帧相同目标)与负样本对(不同目标)。
  • 采用改进的采样策略,从多段视频中选取非连续帧,以提升训练批次中外观与场景的多样性。
  • 引入一个轻量级前馈网络(FFN)投影头,从 DETR 的对象表征中生成跟踪嵌入,实现跟踪与检测头的解耦。
  • 在检测数据集上使用对比学习进行预训练,无需跟踪 ID,利用大规模检测数据提升嵌入空间质量。
  • 训练采用多任务目标,结合检测损失与对比损失,并引入可学习的权重系数调节对比项的贡献。
  • 推理阶段使用二分图匹配,基于学习到的嵌入将预测结果分配给对应轨迹。

实验结果

研究问题

  • RQ1能否在极少架构修改的前提下,有效将基于 DETR 的检测器适配为多目标跟踪系统?
  • RQ2实例级对比学习在复杂跟踪场景下如何提升目标重识别能力?
  • RQ3何种采样策略能最大程度提升对运动、遮挡和外观变化的鲁棒性?
  • RQ4能否在仅包含检测标注的数据集上进行预训练,以提升跟踪性能而无需跟踪标注?
  • RQ5哪些组件对学习联合检测与关联特征至关重要,它们之间如何协同作用?

主要发现

  • ContrasTR 在具有挑战性的 BDD100K 数据集上相较之前 SOTA 实现 +2.6 mMOTA 的性能提升,达到 35.1 mMOTA。
  • 在 MOT17 基准上,ContrasTR 表现与现有基于 Transformer 的方法相当,展现出强大的泛化能力。
  • 消融实验表明,对比损失、投影头和预训练均至关重要:移除任一组件均导致 mHOTA 下降超过 3 个百分点。
  • 最佳性能在 Nv=4(4 个视频)、Nf=10(每视频 10 帧)设置下取得,BDD100K 上实现 36.2 mHOTA 和 33.6 mMOTA。
  • 对比损失权重 λ_contr = 0.5 时性能最优,能有效平衡检测与跟踪目标。
  • 在检测数据上通过对比学习进行预训练,即使在跟踪数据集上微调,也能提升跟踪指标,表明具有强大的迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。