[论文解读] Track to Detect and Segment: An Online Multi-Object Tracker
TraDeS 提出了一种端到端的在线多目标跟踪方法,通过基于代价体的关联和运动引导特征变形模块,利用跟踪线索联合执行检测与分割。该方法在 MOT、nuScenes、MOTS 和 YouTube-VIS 基准测试中实现了最先进性能,具备实时推理能力,在遮挡和运动模糊等挑战性场景下表现出更高的准确性和鲁棒性。
Most online multi-object trackers perform object detection stand-alone in a neural net without any input from tracking. In this paper, we present a new online joint detection and tracking model, TraDeS (TRAck to DEtect and Segment), exploiting tracking clues to assist detection end-to-end. TraDeS infers object tracking offset by a cost volume, which is used to propagate previous object features for improving current object detection and segmentation. Effectiveness and superiority of TraDeS are shown on 4 datasets, including MOT (2D tracking), nuScenes (3D tracking), MOTS and Youtube-VIS (instance segmentation tracking). Project page: https://jialianwu.com/projects/TraDeS.html.
研究动机与目标
- 为解决基于检测的跟踪框架中存在的效率低下和缺乏端到端优化的问题。
- 克服联合检测与跟踪方法在检测阶段忽略跟踪线索的局限性。
- 解决共享主干网络训练中 re-ID 损失与检测损失之间的不兼容性问题。
- 提升在遮挡和运动模糊等挑战性场景下的检测与分割鲁棒性。
- 通过从外观嵌入中提取的运动线索,实现准确的长期数据关联。
提出的方法
- 引入基于代价体的关联(CVA)模块,通过计算帧间目标嵌入之间的匹配相似度来推断跟踪偏移量。
- 将预测的跟踪偏移量作为运动线索,引导运动引导特征变形器(MFW)将前一帧的特征传播到当前帧。
- 采用统一网络架构,使检测与跟踪联合优化,同时在代价体中嵌入 re-ID 监督,以平衡类间与类内差异。
- 利用早期帧的特征传播来增强当前帧的检测与分割,尤其在遮挡或模糊目标上表现更优。
- 通过简单的分割分支将框架扩展至实例分割跟踪,同时保持端到端训练。
- 设计一种与检测损失兼容的 re-ID 损失,通过代价体隐式建模类间差异。
实验结果
研究问题
- RQ1能否有效将跟踪线索整合到检测过程中,以提升在遮挡和运动模糊等复杂视觉条件下的鲁棒性?
- RQ2如何在共享主干网络中联合优化 re-ID 与检测,而不降低检测性能?
- RQ3基于代价体的方法是否能在大位移或低帧率条件下实现准确的长期数据关联?
- RQ4从前一帧传播特征到当前帧,能在多大程度上提升当前帧的检测与分割性能?
- RQ5统一的端到端框架能否优于两阶段的基于检测的跟踪方法以及现有的联合检测与跟踪方法?
主要发现
- 在 MOT16 和 MOT17 基准测试中,TraDeS 实现了最先进性能,分别以 15 FPS 的推理速度超越第二名追踪器 2.5 MOTA 和 1.8 MOTA 分数。
- 在 nuScenes 3D 跟踪基准测试中,TraDeS 在车辆类别上达到 23.2 AMOTA 和 1.07 AMOTP,显著优于以往单目方法。
- 在 MOTS 实例分割跟踪任务中,TraDeS 相较基线模型 IDF1 提升 16.3 分,且在准确率与速度上均优于 TrackR-CNN。
- 在 YouTube-VIS 基准测试中,TraDeS 将 AP 提升 6.2 分,展现出对长时序、长距离跟踪的强大泛化能力。
- 消融实验表明,CVA 和 MFW 模块均至关重要,特征传播显著提升了遮挡情况下的检测性能。
- 所提出的 re-ID 损失设计有效平衡了检测与重识别目标,避免了检测性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。