Skip to main content
QUICK REVIEW

[论文解读] Multi-Sensor 3D Object Box Refinement for Autonomous Driving

Peiliang Li, Siqi Liu|arXiv (Cornell University)|Sep 11, 2019
Robotics and Sensor-Based Localization参考文献 40被引用 9
一句话总结

本文提出了一种统一的两阶段3D目标检测框架,利用单目相机进行初始3D框预测,并通过共享实例向量表示,使用立体视觉或LiDAR数据对结果进行精细化。通过将局部几何结构建模为相对于物体坐标系的3D坐标,该方法实现了光度对齐与点云对齐,从而实现一致的3D精细化,进而在KITTI数据集的单目和立体视觉设置下达到最先进性能,并与LiDAR基线方法相比表现出具有竞争力的结果。

ABSTRACT

We propose a 3D object detection system with multi-sensor refinement in the context of autonomous driving. In our framework, the monocular camera serves as the fundamental sensor for 2D object proposal and initial 3D bounding box prediction. While the stereo cameras and LiDAR are treated as adaptive plug-in sensors to refine the 3D box localization performance. For each observed element in the raw measurement domain (e.g., pixels for stereo, 3D points for LiDAR), we model the local geometry as an instance vector representation, which indicates the 3D coordinate of each element respecting to the object frame. Using this unified geometric representation, the 3D object location can be unified refined by the stereo photometric alignment or point cloud alignment. We demonstrate superior 3D detection and localization performance compared to state-of-the-art monocular, stereo methods and competitive performance compared with the baseline LiDAR method on the KITTI object benchmark.

研究动机与目标

  • 为解决在自动驾驶中融合具有不同模态(图像、视差、点云)的多传感器数据以实现鲁棒3D目标定位的挑战。
  • 开发一种统一的几何表示方法,将传感器元素(像素、3D点)相对于物体坐标系进行建模,以实现一致的3D精细化。
  • 实现立体视觉和LiDAR传感器的自适应、即插即用式集成,以提升单目3D检测性能,而无需对基础检测器进行端到端微调。
  • 在KITTI基准上展示优于当前最先进单目和立体视觉方法的3D检测性能。
  • 通过利用不确定性感知的几何约束,实现多传感器模态的自然融合。

提出的方法

  • 采用基于Faster R-CNN的轻量化单目3D检测器,生成初始2D区域提议和3D边界框。
  • 引入实例向量表示法,以编码每个传感器元素(如像素、3D点)相对于物体局部坐标系的3D坐标。
  • 对于立体视觉精细化,采用基于区域的全卷积网络预测实例向量和分割掩码,通过图像扭曲和误差最小化实现左右图像之间的光度对齐。
  • 对于LiDAR精细化,使用PointNet回归逐点实例向量,通过最小化投影误差到原始LiDAR点实现点云对齐。
  • 在立体视觉和LiDAR中均应用相同的几何能量最小化框架,实现基于传感器特异性物理模型的统一3D框精细化。
  • 通过在精细化过程中结合来自多个传感器的不确定性感知几何约束,自然实现传感器融合。

实验结果

研究问题

  • RQ1统一的几何表示是否能有效弥合图像、视差和点云等不同传感器模态之间的差距,以实现3D目标精细化?
  • RQ2所提出的实例向量表示如何在立体视觉和LiDAR传感器之间实现一致的3D定位精细化?
  • RQ3立体视觉和LiDAR作为即插即用传感器,能在多大程度上在不重新训练基础检测器的前提下提升单目3D检测性能?
  • RQ4所提出的方法是否在KITTI基准上实现了单目和立体视觉3D检测的最先进性能?
  • RQ5与单传感器基线相比,多传感器的不确定性感知融合如何提升3D定位精度?

主要发现

  • 在KITTI基准上,使用单目+LiDAR输入,该方法在车辆类别上达到88.29%的3D AP(AP3d),优于基线F-PointNet(v1)方法。
  • 在单目+立体视觉输入下,该方法在易难度设置下对车辆类别的3D AP(AP3d)达到74.88%,显著优于仅使用单目的检测方法。
  • 该方法与仅使用LiDAR的基线方法相比表现出具有竞争力的性能,在车辆类别上达到76.65%的鸟瞰图AP(APbv),而基线F-PointNet(v1)为77.09%。
  • 融合单目、立体视觉和LiDAR数据仅带来微小增益(易难度车辆类别AP3d为88.37%),表明立体视觉的有限探测范围限制了其在仅使用LiDAR基础上的性能提升。
  • 实例向量表示法实现了跨传感器类型的稳定3D精细化,定性结果表明表面贴合与中心定位均得到改善。
  • 该方法在单目和立体视觉3D检测中达到最先进性能,同时与基于LiDAR的方法相比保持了具有竞争力的结果,充分证明了统一几何框架的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。