Skip to main content
QUICK REVIEW

[论文解读] Robust Multi-Modality Multi-Object Tracking

Wenwei Zhang, Hui Zhou|arXiv (Cornell University)|Sep 9, 2019
Video Surveillance and Tracking Methods参考文献 49被引用 13
一句话总结

该论文提出 mmMOT,一种与传感器无关的端到端多模态多目标跟踪框架,通过一种新颖的融合模块和邻接估计器,融合图像与激光雷达点云特征,以提升跟踪的可靠性和准确性。该方法在 KITTI 基准上实现了最先进性能,通过联合优化模态特定的特征提取器与跨模态关联,是首个在多目标跟踪中使用深度点云表征进行数据关联的模型。

ABSTRACT

Multi-sensor perception is crucial to ensure the reliability and accuracy in autonomous driving system, while multi-object tracking (MOT) improves that by tracing sequential movement of dynamic objects. Most current approaches for multi-sensor multi-object tracking are either lack of reliability by tightly relying on a single input source (e.g., center camera), or not accurate enough by fusing the results from multiple sensors in post processing without fully exploiting the inherent information. In this study, we design a generic sensor-agnostic multi-modality MOT framework (mmMOT), where each modality (i.e., sensors) is capable of performing its role independently to preserve reliability, and further improving its accuracy through a novel multi-modality fusion module. Our mmMOT can be trained in an end-to-end manner, enables joint optimization for the base feature extractor of each modality and an adjacency estimator for cross modality. Our mmMOT also makes the first attempt to encode deep representation of point cloud in data association process in MOT. We conduct extensive experiments to evaluate the effectiveness of the proposed framework on the challenging KITTI benchmark and report state-of-the-art performance. Code and models are available at https://github.com/ZwwWayne/mmMOT.

研究动机与目标

  • 通过设计多传感器、多模态跟踪系统,解决自动驾驶感知中的可靠性-准确性权衡问题。
  • 克服现有 MOT 框架中对单一传感器的依赖,特别是在传感器故障或恶劣条件下的局限性。
  • 通过实现多模态特征的深度融合,特别是将深度点云表征引入数据关联,提升跟踪精度。
  • 开发一个端到端可训练的框架,联合优化特征提取与跨模态关联,以实现更好的泛化能力。
  • 通过利用互补的传感器模态,在遮挡、远距离和光照不良等挑战性条件下保持鲁棒性。

提出的方法

  • 设计一种与传感器无关的框架,使每种模态(摄像头、激光雷达、雷达)独立提取特征,从而在传感器故障时仍能保持可靠性。
  • 引入一种新颖的多模态融合模块,在将特征传递给邻接估计器进行跨模态跟踪之前,融合来自不同传感器的特征。
  • 采用端到端训练,联合优化模态特定的特征提取器与邻接矩阵估计器,以学习鲁棒的跨模态关联。
  • 通过 PointNet 对激光雷达点云进行深度表征学习,并将这些特征直接用于数据关联过程,这是 MOT 领域的创新方法。
  • 在邻接估计模块中,使用绝对差值计算相关性,使用加法后接 softmax 进行排序。
  • 在 VGG-16 中使用跳跃池化以聚合多尺度图像特征,并使用 RRC-Net 进行 2D 检测,结合基于视锥的点云提取。

实验结果

研究问题

  • RQ1多模态 MOT 框架是否能在某一传感器失效时仍保持高可靠性,同时通过特征融合实现卓越的准确性?
  • RQ2与传统手工设计或仅基于图像的特征相比,深度点云表征在数据关联阶段的使用效果如何?
  • RQ3对特征提取器与邻接估计器进行端到端联合优化,在多大程度上提升了跟踪的鲁棒性与准确性?
  • RQ4在遮挡、远距离和低光照等挑战性条件下,融合模块的表现如何?
  • RQ5单一模型是否能在单模态与多模态设置下均实现具有竞争力的性能,尤其是在传感器失效的情况下?

主要发现

  • mmMOT 框架在仅使用图像与点云模态的在线设置下,在 KITTI 跟踪基准上实现了最先进性能。
  • 即使在单模态运行(如仅摄像头)时,模型仍表现出具有竞争力的性能,与多模态设置相比仅下降 0.28%。
  • 故障分析表明,在高遮挡和远距离条件下,融合显著减少了 ID 切换次数,而单模态跟踪器在此类场景下失败更频繁。
  • 点云模态在稀疏或遮挡场景中对鲁棒性贡献更大,尽管在小物体或远距离物体上因点云密度低而表现受限。
  • 与单模态基线相比,该模型在遮挡和远距离跟踪方面更具鲁棒性,融合模块能有效减少复杂情况下的错误。
  • 在数据关联中使用深度点云特征可提升跟踪的一致性,尤其在视觉线索弱或模糊时效果更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。