Skip to main content
QUICK REVIEW

[论文解读] PointIT: A Fast Tracking Framework Based on 3D Instance Segmentation

Yuan Wang, Yang Yu|arXiv (Cornell University)|Feb 18, 2019
Remote Sensing and LiDAR Applications参考文献 21被引用 7
一句话总结

PointIT 提出了一种基于球面 LiDAR 投影的快速、轻量级 3D 目标跟踪框架,结合 3D 实例分割。通过在基于 Mask R-CNN 的实例分割头中用 MobileNet 替代 ResNet,并扩展 SORT 算法以实现基于 3D 中心点的代价矩阵计算,该方法在 KITTI 数据集上实现了 15 fps 的跟踪速度与 0.617 的 AP,显著提升了对遮挡和目标交互场景的鲁棒性。

ABSTRACT

Recently most popular tracking frameworks focus on 2D image sequences. They seldom track the 3D object in point clouds. In this paper, we propose PointIT, a fast, simple tracking method based on 3D on-road instance segmentation. Firstly, we transform 3D LiDAR data into the spherical image with the size of 64 x 512 x 4 and feed it into instance segment model to get the predicted instance mask for each class. Then we use MobileNet as our primary encoder instead of the original ResNet to reduce the computational complexity. Finally, we extend the Sort algorithm with this instance framework to realize tracking in the 3D LiDAR point cloud data. The model is trained on the spherical images dataset with the corresponding instance label masks which are provided by KITTI 3D Object Track dataset. According to the experiment results, our network can achieve on Average Precision (AP) of 0.617 and the performance of multi-tracking task has also been improved.

研究动机与目标

  • 通过整合 3D 空间信息以增强目标跟踪的鲁棒性,解决 2D 跟踪框架在 3D 感知中的局限性。
  • 在保持高精度的同时降低 3D 实例分割的计算成本,以实现自动驾驶车辆的实时部署。
  • 通过利用精确的 3D 实例掩码,提升在遮挡和目标交互等复杂场景下的跟踪性能。
  • 构建一个可扩展的端到端流水线,结合球面投影、轻量级分割与扩展的 SORT 算法,实现 3D 多目标跟踪。
  • 证明 3D 实例级信息相较于基于 2D 检测框的方法能显著提升跟踪精度。

提出的方法

  • 将 3D LiDAR 点云投影为 64×512×4 大小的球面图像,将 3D 数据转换为适合高效深度学习处理的 2D 格式。
  • 在实例分割头中使用轻量级 MobileNet 替代 ResNet,以降低计算复杂度与推理时间。
  • 在从 KITTI 3D 目标跟踪数据集衍生的新型球面图像数据集上训练基于 Mask R-CNN 的实例分割模型,该数据集包含实例级标注。
  • 通过引入 3D 中心坐标与归一化距离度量,扩展 SORT 跟踪算法,不再仅依赖 IoU 进行数据关联。
  • 利用 3D 空间特征(中心点距离)与实例掩码嵌入构建跟踪代价矩阵,以提升关联准确性。
  • 端到端处理整个流水线,实现在 KITTI 数据集上 15 fps 的实时 3D 多目标跟踪。

实验结果

研究问题

  • RQ1与基于 2D 检测框的跟踪相比,基于球面 LiDAR 投影的 3D 实例分割是否能提升跟踪的鲁棒性?
  • RQ2在 3D 点云跟踪中,用 MobileNet 替代 ResNet 对实例分割精度与推理速度有何影响?
  • RQ3将 3D 空间中心信息引入 SORT 算法后,能在多大程度上减少 ID 切换与跟踪错误?
  • RQ4轻量级 3D 实例分割框架能否在保持实时性能的同时实现高精度,适用于自动驾驶应用?
  • RQ5与原始 3D 处理相比,球面投影方法在处理遮挡与点云噪声方面表现如何?

主要发现

  • PointIT 在 KITTI 3D 实例分割基准上实现了 0.617 的平均精度(AP),表明其具备出色的分割性能。
  • 该模型运行速度达 15 fps,表明其在自动驾驶系统中具备实时在线 3D 跟踪的可行性。
  • 使用 MobileNet 替代 ResNet 后,推理时间从 0.091 秒降低至 0.061 秒,同时保持高 AP,体现出高效的精度-速度权衡。
  • 扩展后的 SORT 算法显著减少了 ID 切换(ID_sw)与漏检(FN),表明在遮挡高发场景下具备更高的跟踪稳定性。
  • 在关联矩阵中引入基于 3D 中心点的距离信息,显著提升了跟踪性能,尤其在目标交互与遮挡场景下优于标准的 IoU 基于 SORT。
  • 尽管标准 2D 图像与球面投影之间存在领域差异,MobileNet 仍实现了 0.617 的 AP,表明模型对投影后的球面数据具备良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。