[论文解读] Simple Cues Lead to a Strong Multi-Object Tracker
该论文提出GHOST,一种简单但强大的基于检测的跟踪器,通过结合重识别(reID)模型与线性运动模型,在四个不同数据集(MOT17、MOT20、BDD100k、DanceTrack)上实现了最先进性能。它引入了实时域自适应机制,并对活跃/非活跃轨迹采用差异化处理策略,从而在无需任何跟踪专用训练数据的情况下实现强大性能。
For a long time, the most common paradigm in Multi-Object Tracking was tracking-by-detection (TbD), where objects are first detected and then associated over video frames. For association, most models resourced to motion and appearance cues, e.g., re-identification networks. Recent approaches based on attention propose to learn the cues in a data-driven manner, showing impressive results. In this paper, we ask ourselves whether simple good old TbD methods are also capable of achieving the performance of end-to-end models. To this end, we propose two key ingredients that allow a standard re-identification network to excel at appearance-based tracking. We extensively analyse its failure cases, and show that a combination of our appearance features with a simple motion model leads to strong tracking results. Our tracker generalizes to four public datasets, namely MOT17, MOT20, BDD100k, and DanceTrack, achieving state-of-the-art performance. https://github.com/dvl-tum/GHOST.
研究动机与目标
- 探究传统基于检测的跟踪方法若使用手工设计的线索,是否能够匹配或超越端到端注意力机制模型。
- 识别标准reID模型在应用于MOT时的关键设计缺陷,尤其是在长期遮挡和图像统计特性变化的情况下。
- 开发一种通用跟踪器,可在无需针对特定数据集调优或使用跟踪数据训练的前提下,在多样化数据集上表现良好。
- 证明领域特定知识与恰当线索融合可超越复杂且数据依赖性强的模型。
提出的方法
- 引入实时域自适应机制,以对齐在不同视觉条件和时间跨度下的reID特征。
- 对活跃与非活跃轨迹应用不同的关联策略,以提升长期跟踪的稳定性。
- 通过加权和方式融合外观与运动线索,动态调整权重以适应不同数据集的需求。
- 采用线性运动模型,结合速度估计与类似卡尔曼滤波的更新机制,确保运动一致性。
- 使用标准匈牙利算法,基于外观与运动距离的复合代价矩阵,完成检测与轨迹之间的二分图匹配。
- 仅针对每个数据集调整高层超参数(如阈值、运动权重、轨迹历史长度),而非针对每条序列或模型架构进行调整。
![Figure 1 : IDF1/Rank-1 of different state-of-the-art re-ID approaches. R50-TR [ 82 ] , BOT [ 37 ] , BDB [ 16 ] , ABD [ 12 ] . Basic is our baseline, Ours is our appearance model.](https://ar5iv.labs.arxiv.org/html/2206.04656/assets/x1.png)
实验结果
研究问题
- RQ1仅使用手工设计的外观与运动线索的简单基于检测跟踪流程,是否能在不使用跟踪数据训练的情况下实现最先进性能?
- RQ2为何最先进reID模型在reID基准测试中表现优异,但在MOT中却表现不佳?
- RQ3在哪些跟踪场景下,仅依靠外观线索已不足,而运动建模成为必要?
- RQ4如何通过域自适应与轨迹状态感知处理提升真实世界MOT场景中基于reID的跟踪性能?
主要发现
- GHOST在MOT17、MOT20、BDD100k和DanceTrack上均实现了最先进性能,且未在任何跟踪数据集上进行训练。
- 所提出的实时域自适应机制显著提升了reID特征在不同图像统计特性和时间间隔下的鲁棒性。
- 对活跃与非活跃轨迹采用差异化处理策略,有效减少了轨迹碎片化,并提升了长期关联的准确性。
- 通过自适应加权融合外观与运动线索的策略,优于仅使用外观或运动的模型,尤其在遮挡和低可见度条件下表现更优。
- 尽管结构简单,GHOST仍保持了具有竞争力的推理速度(在MOT17上使用私有检测结果时约为6FPS),与SOTA跟踪器相当。
- 可视化结果证实,GHOST能正确关联长达9.4秒的长期遮挡以及可见度分数仅为0.2的低可见度情况下的行人,而CenterTrack在此类情况下失败。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。