Skip to main content
QUICK REVIEW

[论文解读] Faraway-Frustum: Dealing with Lidar Sparsity for 3D Object Detection using Fusion

Haolin Zhang, Dongfang Yang|arXiv (Cornell University)|Nov 3, 2020
Robotics and Sensor-Based Localization参考文献 27被引用 6
一句话总结

本文提出了一种名为Faraway-Frustum的新颖3D目标检测方法,通过融合2D RGB视觉信息用于远距离物体分类,结合稀疏激光雷达点云聚类实现3D定位,显著优于KITTI基准中当前最先进方法在远距离目标检测上的表现,尤其在60米以外的行人和75米以外的车辆检测中表现突出。

ABSTRACT

Learned pointcloud representations do not generalize well with an increase in distance to the sensor. For example, at a range greater than 60 meters, the sparsity of lidar pointclouds reaches to a point where even humans cannot discern object shapes from each other. However, this distance should not be considered very far for fast-moving vehicles: A vehicle can traverse 60 meters under two seconds while moving at 70 mph. For safe and robust driving automation, acute 3D object detection at these ranges is indispensable. Against this backdrop, we introduce faraway-frustum: a novel fusion strategy for detecting faraway objects. The main strategy is to depend solely on the 2D vision for recognizing object class, as object shape does not change drastically with an increase in depth, and use pointcloud data for object localization in the 3D space for faraway objects. For closer objects, we use learned pointcloud representations instead, following state-of-the-art. This strategy alleviates the main shortcoming of object detection with learned pointcloud representations. Experiments on the KITTI dataset demonstrate that our method outperforms state-of-the-art by a considerable margin for faraway object detection in bird's-eye-view and 3D. Our code is open-source and publicly available: https://github.com/dongfang-steven-yang/faraway-frustum.

研究动机与目标

  • 解决在60米以外远距离目标检测中激光雷达点云极度稀疏的严峻挑战。
  • 识别出学习得到的点云表征因形状信息丢失而无法泛化至远距离稀疏目标。
  • 克服当前基于激光雷达的检测器依赖于在近距离数据上训练的深度神经网络所带来的局限性,这些方法在远距离目标上表现欠佳。
  • 设计一种融合策略,利用密集的2D图像数据进行物体类别识别,同时利用稀疏点云进行3D定位,以提升远距离检测的鲁棒性。
  • 证明在裁剪后的稀疏点云上进行聚类,相比学习到的表征,在远距离目标定位上更具优势。

提出的方法

  • 利用RGB图像中的2D实例分割掩码或边界框,在3D激光雷达空间中生成候选物体的圆锥体(frustum)。
  • 对点云应用聚类算法,估计每个物体在圆锥体内的3D中心位置,并基于距离阈值区分远距离物体。
  • 对于远距离物体(如行人超过60米,车辆超过75米),基于估计的中心位置和裁剪后的点云,使用专用的Faraway Frustum网络(FF-Net)回归3D边界框。
  • 对于非远距离物体,直接使用学习到的点云表征(如PV-RCNN)进行3D框拟合,保持与当前最先进方法的兼容性。
  • 融合2D检测结果与激光雷达数据,构建一种混合检测流程,根据物体距离动态调整策略。
  • 训练FF-Net以利用稀疏点云优化深度和边界框形状,避免依赖于密集近距离数据学习到的表征。

实验结果

研究问题

  • RQ1当激光雷达点云过于稀疏而无法进行基于形状的检测时,能否有效利用基于2D视觉的物体识别来检测远距离物体?
  • RQ2在极稀疏、裁剪后的激光雷达点云上进行聚类,是否优于在密集点云上训练的深度神经网络在远距离3D目标定位中的表现?
  • RQ3一种结合2D检测与稀疏点云处理的混合检测策略,是否能在不降低近中距离物体检测性能的前提下,实现远距离目标检测的优越性能?
  • RQ4当前最先进基于激光雷达的3D检测器在真实世界基准(如KITTI)中对远距离物体的失败程度如何?
  • RQ5是否可行设计一种模块化检测系统,根据物体距离在学习表征与基于聚类的定位之间动态切换?

主要发现

  • 在KITTI验证集上,该方法在鸟瞰图下对远距离行人(>60米)实现了45.45%的mAP,较最佳SOTA方法(Frustum PointNets)高出45.45个百分点。
  • 对远距离车辆(>75米),该方法在鸟瞰图下实现了46.90%的mAP,较次佳方法(Frustum PointNets)高出46.90个百分点。
  • 在3D检测中,该方法对远距离行人(>60米)实现了44.54%的mAP,对远距离车辆(>75米)实现了46.90%的mAP,显著优于SOTA方法在这些类别中报告的0.00% mAP。
  • 该方法在非远距离物体(Easy/Mod/Hard基准)上保持了SOTA水平的性能,mAP得分在所有IoU阈值下与PV-RCNN相当或略高。
  • 定性结果表明,仅本方法在SOTA方法完全失效的复杂场景中成功检测到远距离行人和车辆。
  • 消融实验验证了在稀疏点云上基于聚类的定位优于学习表征,证实了核心设计选择的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。