Skip to main content
QUICK REVIEW

[论文解读] CC-3DT: Panoramic 3D Object Tracking via Cross-Camera Fusion

Tobias Fischer, Yung-Hsu Yang|arXiv (Cornell University)|Dec 2, 2022
Video Surveillance and Tracking Methods被引用 14
一句话总结

CC-3DT 提出了一种全景 3D 目标跟踪方法,该方法在时间关联之前融合来自多个摄像头的 3D 检测结果和外观特征,实现了跨摄像头与时间维度的联合跟踪。该方法减少了身份切换并提升了运动建模能力,在使用相同 3D 检测器的情况下,相较于以往基于摄像头的方法,其在 NuScenes 基准测试上的 AMOTA 提升了 12.6%,达到了新的最先进水平。

ABSTRACT

To track the 3D locations and trajectories of the other traffic participants at any given time, modern autonomous vehicles are equipped with multiple cameras that cover the vehicle's full surroundings. Yet, camera-based 3D object tracking methods prioritize optimizing the single-camera setup and resort to post-hoc fusion in a multi-camera setup. In this paper, we propose a method for panoramic 3D object tracking, called CC-3DT, that associates and models object trajectories both temporally and across views, and improves the overall tracking consistency. In particular, our method fuses 3D detections from multiple cameras before association, reducing identity switches significantly and improving motion modeling. Our experiments on large-scale driving datasets show that fusion before association leads to a large margin of improvement over post-hoc fusion. We set a new state-of-the-art with 12.6% improvement in average multi-object tracking accuracy (AMOTA) among all camera-based methods on the competitive NuScenes 3D tracking benchmark, outperforming previously published methods by 6.5% in AMOTA with the same 3D detector.

研究动机与目标

  • 为解决多摄像头自动驾驶系统中因跨摄像头关联能力有限而导致的 3D 目标跟踪不一致问题。
  • 通过在时间关联之前融合多个摄像头的 3D 检测结果,提升跟踪一致性并减少身份切换。
  • 通过利用跨摄像头轨迹信息增强运动建模,尤其针对首次进入摄像头视野的物体。
  • 在大规模基准测试(如 NuScenes 和 Waymo Open)上建立基于摄像头的 3D 多目标跟踪新最先进水平。

提出的方法

  • 该方法在每个摄像头视角下独立执行 3D 目标检测和外观特征提取。
  • 将 3D 检测结果和特征从相机坐标系转换到世界坐标系,并通过 3D 非极大值抑制进行融合。
  • 使用运动和外观线索,通过统一的跟踪组件在所有摄像头和时间维度上关联检测结果。
  • 跨摄像头关联支持更优的运动建模,从而提升新出现物体的检测质量。
  • 该跟踪器利用多摄像头轨迹信息构建运动模型,以增强跟踪一致性。
  • 该框架具有模块化设计,可兼容多种 3D 检测器,包括 Faster R-CNN、DETR3D 和 BEVFormer。

实验结果

研究问题

  • RQ1在关联前进行跨摄像头 3D 检测融合,是否能显著提升 3D 多目标跟踪性能,相比事后融合?
  • RQ2联合跨摄像头与时间维度的关联如何影响运动建模精度与跟踪一致性?
  • RQ3跨摄像头融合在多大程度上减少了身份切换并提升了全景 3D 跟踪的轨迹平滑性?
  • RQ4是否能够证明,一个融合多摄像头检测结果的统一跟踪组件,优于单摄像头基线方法及现有跨摄像头跟踪方法?
  • RQ5所提出方法是否在 NuScenes 和 Waymo Open 数据集上均实现了最先进性能,并在各项指标上保持一致的提升?

主要发现

  • 在 NuScenes 验证集上,CC-3DT 达到了 42.9% 的新最先进 AMOTA 指标,当使用相同 3D 检测器(DETR3D)时,相比之前的最先进方法 MUTR3D 提升了 12.6%。
  • 当使用更强的 BEVFormer 检测器时,CC-3DT 相较于 MUTR3D 在 AMOTA 上提升了 13.5%,表明其在不同检测器类型下均保持一致的优越性。
  • 在 Waymo Open 基准测试中,CC-3DT 在 0.3 IoU 阈值下实现了 20.32% 的 MOTA 和 6.9% 的错匹配率,整体性能和关联性能均优于 QD-3DT。
  • 在使用 Faster R-CNN 检测器时,CC-3DT 在 NuScenes 验证集上实现了最低的 IDS(2536),表明其关联精度更优。
  • 在相同检测器下,CC-3DT 将 AMOTP 从 MUTR3D 的 1.498 降低至 1.433,表明其 3D 检测框预测更加精确。
  • 跨摄像头运动模型显著提升了跟踪性能,优于 MUTR3D 中使用的卡尔曼滤波基线方法,尽管检测召回率较低,但身份切换显著减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。