Skip to main content
QUICK REVIEW

[论文解读] Quasi-Dense Similarity Learning for Multiple Object Tracking

Jiangmiao Pang, Linlu Qiu|arXiv (Cornell University)|Jun 11, 2020
Video Surveillance and Tracking Methods参考文献 52被引用 18
一句话总结

本文提出了一种准密集相似性学习(Quasi-Dense Similarity Learning),一种对比学习方法,通过在图像对之间密集采样数百个区域提议,以提升多目标跟踪中的实例相似性学习。通过利用准密集的正样本和负样本,该方法在推理阶段仅需简单的最近邻搜索,实现了最先进性能:在不使用外部数据的情况下,于MOT17上达到68.7 MOTA和20.3 FPS,且在BDD100K和Waymo上实现了接近10个百分点的MOTA提升,同时ID切换次数更少。

ABSTRACT

Similarity learning has been recognized as a crucial step for object tracking. However, existing multiple object tracking methods only use sparse ground truth matching as the training objective, while ignoring the majority of the informative regions on the images. In this paper, we present Quasi-Dense Similarity Learning, which densely samples hundreds of region proposals on a pair of images for contrastive learning. We can directly combine this similarity learning with existing detection methods to build Quasi-Dense Tracking (QDTrack) without turning to displacement regression or motion priors. We also find that the resulting distinctive feature space admits a simple nearest neighbor search at the inference time. Despite its simplicity, QDTrack outperforms all existing methods on MOT, BDD100K, Waymo, and TAO tracking benchmarks. It achieves 68.7 MOTA at 20.3 FPS on MOT17 without using external training data. Compared to methods with similar detectors, it boosts almost 10 points of MOTA and significantly decreases the number of ID switches on BDD100K and Waymo datasets. Our code and trained models are available at http://vis.xyz/pub/qdtrack.

研究动机与目标

  • 为解决现有多目标跟踪相似性学习中稀疏监督的局限性,即过度依赖真实边界框而未能充分利用图像中其他信息丰富的区域。
  • 通过在图像对之间密集采样区域提议,改进实例级相似性学习,以提供更丰富的监督信号和难负样本。
  • 通过仅使用相似性匹配和最近邻搜索,实现简单且端到端的跟踪流程,避免使用复杂的回归头或运动先验。
  • 通过引入未匹配对象(背景)并强制匹配过程的双向一致性,减少ID切换和误报。
  • 构建一个即插即用的跟踪框架,与现有检测器兼容,仅通过最小的架构修改即可实现高精度。

提出的方法

  • 该方法在连续两帧之间对数百个区域提议执行准密集匹配,使用真实边界框及周围候选区域作为样本。
  • 将对比学习扩展至支持每个查询对应多个正样本,使每个提议能够同时区分参考图像上的所有其他提议。
  • 在当前检测结果、历史轨迹和背景之间应用双向Softmax,以增强一致性并抑制误报。
  • 该框架可与Faster R-CNN等标准检测器集成,并使用轻量级嵌入头结合残差网络进行特征提取。
  • 推理阶段仅在学习到的嵌入空间中执行简单的最近邻搜索,无需位移回归或运动建模。
  • 整个系统端到端训练,简化了训练与部署流程,同时保持高效率。

实验结果

研究问题

  • RQ1在图像对之间密集采样区域提议,是否能超越稀疏监督,提升多目标跟踪中的实例相似性学习?
  • RQ2准密集对比学习是否能构建更具判别性的特征空间,从而通过简单的最近邻匹配实现精确跟踪?
  • RQ3所提出的方法是否能在不依赖运动先验或回归头的情况下,减少ID切换和误报?
  • RQ4在匹配过程中引入背景(未匹配对象)对跟踪鲁棒性与一致性有何影响?
  • RQ5即插即用的相似性学习模块在MOT17、BDD100K、Waymo和TAO等多样化基准上,能在多大程度上提升跟踪性能?

主要发现

  • QDTrack在不使用任何外部训练数据的情况下,于MOT17上实现68.7 MOTA和20.3 FPS,创下该基准新SOTA。
  • 在BDD100K和Waymo上,QDTrack相比使用相似检测器的方法,MOTA提升接近10个百分点,ID切换显著减少。
  • 该方法在所有评估基准(MOT、BDD100K、Waymo和TAO)上均优于所有现有跟踪方法。
  • 在匹配过程中引入背景对象可减少误报,可视化结果表明,误报主要被匹配至背景。
  • 推理流程的简洁性——仅依赖嵌入空间中的最近邻搜索——表明,无需复杂关联模块即可实现强大跟踪性能。
  • 该框架与标准检测器兼容,支持端到端训练,简化了整体跟踪流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。