Skip to main content
QUICK REVIEW

[论文解读] SoDA: Multi-Object Tracking with Soft Data Association

Wei-Chih Hung, Henrik Kretzschmar|arXiv (Cornell University)|Aug 18, 2020
Video Surveillance and Tracking Methods参考文献 51被引用 6
一句话总结

SoDA 提出了一种新颖的多目标跟踪框架,利用自注意力机制从时空上下文中计算轨迹嵌入,实现软数据关联和显式的遮挡推理。通过聚合所有检测结果中的信息而无需硬性关联,该方法在 Waymo Open Dataset 上实现了最先进性能,MOTA 提升 5.0%,IDS 降低 30.8%。

ABSTRACT

Robust multi-object tracking (MOT) is a prerequisite fora safe deployment of self-driving cars. Tracking objects, however, remains a highly challenging problem, especially in cluttered autonomous driving scenes in which objects tend to interact with each other in complex ways and frequently get occluded. We propose a novel approach to MOT that uses attention to compute track embeddings that encode the spatiotemporal dependencies between observed objects. This attention measurement encoding allows our model to relax hard data associations, which may lead to unrecoverable errors. Instead, our model aggregates information from all object detections via soft data associations. The resulting latent space representation allows our model to learn to reason about occlusions in a holistic data-driven way and maintain track estimates for objects even when they are occluded. Our experimental results on the Waymo OpenDataset suggest that our approach leverages modern large-scale datasets and performs favorably compared to the state of the art in visual multi-object tracking.

研究动机与目标

  • 解决复杂、遮挡严重的自动驾驶场景中鲁棒的多目标跟踪挑战。
  • 克服硬性数据关联的局限性,后者可能导致错误传播和无法恢复的跟踪失败。
  • 通过从所有检测结果中学习潜在表征,实现对遮挡的全局、数据驱动推理。
  • 利用大规模数据集学习对象与轨迹之间的复杂长程依赖关系,而无需启发式调参。
  • 开发一种统一框架,避免依赖手工设计的阈值或多重假设跟踪启发式规则。

提出的方法

  • 将多目标跟踪建模为序列到序列问题,使用类似 Transformer 的自注意力层来编码检测结果之间的时空上下文。
  • 通过注意力度量编码计算轨迹嵌入,聚合时间窗口内所有检测结果的特征,实现软数据关联。
  • 引入潜在状态表示 $ z_{\text{occ}} $,基于上下文特征显式建模遮挡可能性。
  • 使用统一的注意力机制计算所有检测结果与轨迹之间的相似度得分,避免硬性关联决策。
  • 在大规模数据集(如 Waymo Open Dataset)上端到端训练模型,学习鲁棒且上下文感知的轨迹表征。
  • 通过在注意力机制中结合外观特征(通过 ROI Align 提取)与边界框坐标,实现对不同特征模态的泛化能力。

实验结果

研究问题

  • RQ1基于注意力的建模能否有效替代多目标跟踪中的硬性数据关联,从而减少错误传播?
  • RQ2从所有检测结果中学习到的潜在空间表征是否能提升遮挡情况下的跟踪鲁棒性?
  • RQ3数据驱动的软关联机制在多大程度上能超越基于启发式规则或多重假设的方法?
  • RQ4该模型在具有不同相机视角、帧率和分辨率的多样化序列上泛化能力如何?
  • RQ5在大规模数据集上进行预训练是否能提升在较小基准(如 MOT17 或 KITTI)上的性能?

主要发现

  • 在 Waymo Open Dataset 上,SoDA 实现了 55.9% 的 MOTA 和 44.3% 的 IDF1,优于 Tracktor++(53.5% MOTA),MOTA 提升 5.0%,IDS 降低 30.8%。
  • 当模型可访问未来帧(接下来的 2 帧)时,性能进一步提升,表明其有效利用了时间上下文以优化关联决策。
  • 在 Waymo Open Dataset 上预训练并在 KITTI 上评估时,SoDA 实现了 IDS 17% 的降低,证明大规模预训练的优势。
  • 该方法对不同特征输入具有泛化能力,表现为结合 ROI-Align 提取的外观特征与边界框特征后性能提升。
  • 定性结果表明,SoDA 通过利用潜在空间中编码的上下文场景信息,成功实现了对复杂遮挡中物体的跟踪。
  • 在 MOT17 基准上,SoDA 表现与最先进方法相当,尤其在使用私有检测结果时,凸显其对检测器噪声的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。