Skip to main content
QUICK REVIEW

[论文解读] OCM3D: Object-Centric Monocular 3D Object Detection

Liang Peng, Fei Liu|arXiv (Cornell University)|Apr 13, 2021
Advanced Neural Network Applications参考文献 41被引用 11
一句话总结

OCM3D 提出了一种以物体为中心的体素表示方法,通过自适应地将单目深度图和RGB图像编码为每个物体提议的3D体素,提升了检测精度。该方法利用局部物体区域进行姿态估计,并引入了一种分解的3D置信度机制。在KITTI数据集上,其性能达到当前最先进水平,优于以往方法,并在行人检测任务中接近基于LiDAR的结果。

ABSTRACT

Image-only and pseudo-LiDAR representations are commonly used for monocular 3D object detection. However, methods based on them have shortcomings of either not well capturing the spatial relationships in neighbored image pixels or being hard to handle the noisy nature of the monocular pseudo-LiDAR point cloud. To overcome these issues, in this paper we propose a novel object-centric voxel representation tailored for monocular 3D object detection. Specifically, voxels are built on each object proposal, and their sizes are adaptively determined by the 3D spatial distribution of the points, allowing the noisy point cloud to be organized effectively within a voxel grid. This representation is proved to be able to locate the object in 3D space accurately. Furthermore, prior works would like to estimate the orientation via deep features extracted from an entire image or a noisy point cloud. By contrast, we argue that the local RoI information from the object image patch alone with a proper resizing scheme is a better input as it provides complete semantic clues meanwhile excludes irrelevant interferences. Besides, we decompose the confidence mechanism in monocular 3D object detection by considering the relationship between 3D objects and the associated 2D boxes. Evaluated on KITTI, our method outperforms state-of-the-art methods by a large margin. The code will be made publicly available soon.

研究动机与目标

  • 为解决现有单目3D检测方法依赖图像或伪LiDAR表示所带来的局限性,这些方法在处理噪声深度数据和空间建模方面表现不佳。
  • 通过仅使用物体图像区域而非完整图像或噪声点云进行姿态估计,提升姿态估计性能,减少无关背景信息的干扰。
  • 将3D检测置信度解耦为2D检测置信度和从2D到3D的提升难度,实现在无需3D标注的情况下实现更优的置信度校准。
  • 通过提出一种非重叠的新数据集划分方式,解决KITTI基准中深度估计的训练集与验证集存在重叠这一关键数据泄露问题。

提出的方法

  • 该方法基于深度估计的点云,为每个2D物体提议构建自适应体素,其中体素大小根据点云在3D空间中的分布动态调整,以增强密集区域并抑制稀疏异常点。
  • 仅使用裁剪后的物体图像区域(采用合适缩放方案)作为姿态估计的输入,聚焦于局部语义信息,消除背景干扰。
  • 提出一种新颖的分解式3D置信度机制,结合2D检测置信度与2D和3D边界框投影之间的IoU类重叠度量,用于衡量从2D到3D的提升难度。
  • 以物体为中心的体素表示设计用于有效编码RGB与深度信息,同时对单目伪LiDAR点云中常见的长尾分布和噪声具有鲁棒性。
  • 该框架具备即插即用特性:置信度与姿态模块可无缝集成到任意基于2D检测器的单目3D检测器中,无需重新训练。
  • 提出一种新的、非重叠的KITTI数据集划分方式,以纠正先前基准中存在数据泄露的问题,确保评估的公平性。

实验结果

研究问题

  • RQ1基于3D点云分布自适应调整体素大小的以物体为中心的体素表示,是否能相比伪LiDAR或仅图像的方法,显著提升单目3D检测性能?
  • RQ2在单目3D检测中,仅使用物体图像区域作为输入,是否优于使用完整图像或噪声点云,以实现更优的姿态估计?
  • RQ3一种将2D置信度与2D-3D边界框对齐度量相结合的分解式3D置信度机制,是否能在无需3D标注的情况下,提升检测置信度的校准能力?
  • RQ4KITTI中广泛使用的Eigen划分是否在深度估计中引入了数据泄露?其对单目3D检测器报告性能的影响如何?

主要发现

  • 在中等难度集上,OCM3D在车辆类别上达到96.48%的AP(IoU=0.7),显著优于伪LiDAR(92.85%)和M3D-RPN(89.37%)在相同划分下的表现。
  • 在行人类别上,该方法实现了70.36%的AP 3D(IoU=0.7),优于原始伪LiDAR方法(27.29%),并接近基于LiDAR方法的性能(72.05%)。
  • 将姿态头替换为所提出的物体区域输入后,车辆类别的AOS提升3.3%,行人类别提升10.5%,证明了其有效性。
  • 分解式3D置信度机制使伪LiDAR在中等难度AP 3D上实现了39.87%的相对性能提升,显示出在不同检测器之间具有强大的泛化能力。
  • 新数据集划分消除了数据泄露问题,揭示了以往性能报告因训练集与验证集重叠而被高估。
  • 该方法具有高度可扩展性:当应用于伪LiDAR和PatchNet时,均带来了显著性能增益,验证了其即插即用的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。