Skip to main content
QUICK REVIEW

[论文解读] Joint stereo 3D object detection and implicit surface reconstruction

Shichao Li, Huang, Xijie|arXiv (Cornell University)|Nov 25, 2021
Advanced Vision and Imaging参考文献 86被引用 4
一句话总结

本文提出S-3D-RCNN,一种新颖的两阶段学习框架,能够联合实现从RGB立体图像中进行立体3D目标检测、精确的SO(3)方向估计以及隐式表面重建。通过引入中间几何表示(IGRs),逐步将图像特征映射到3D目标部件坐标,并结合基于点的可见表面建模方法扩展,该方法在KITTI数据集上实现了新的指标下的最先进性能,包括方向估计精度的提升和幻觉形状重建的改善。

ABSTRACT

We present a new learning-based framework S-3D-RCNN that can recover accurate object orientation in SO(3) and simultaneously predict implicit rigid shapes from stereo RGB images. For orientation estimation, in contrast to previous studies that map local appearance to observation angles, we propose a progressive approach by extracting meaningful Intermediate Geometrical Representations (IGRs). This approach features a deep model that transforms perceived intensities from one or two views to object part coordinates to achieve direct egocentric object orientation estimation in the camera coordinate system. To further achieve finer description inside 3D bounding boxes, we investigate the implicit shape estimation problem from stereo images. We model visible object surfaces by designing a point-based representation, augmenting IGRs to explicitly address the unseen surface hallucination problem. Extensive experiments validate the effectiveness of the proposed IGRs, and S-3D-RCNN achieves superior 3D scene understanding performance. We also designed new metrics on the KITTI benchmark for our evaluation of implicit shape estimation.

研究动机与目标

  • 为解决在户外场景中从单目和立体RGB图像中准确估计3D目标属性(尤其是方向和形状)的挑战。
  • 通过引入中间几何表示(IGRs)来弥合2D图像像素与3D几何量之间的语义鸿沟,从而连接外观与3D结构。
  • 将单视角方向估计扩展至立体输入,以提升小尺寸或代表性不足目标(如行人和自行车)的精度与鲁棒性。
  • 通过建模可见表面点,在3D边界框内实现隐式形状重建,并解决未见表面的幻觉问题。
  • 开发新的评估指标——AP_MMD与MMDTP,以超越标准3D检测指标,评估形状检索与表面几何保真度。

提出的方法

  • 该框架采用两阶段流程:首先从立体RGB图像生成3D目标提议,然后利用IGRs对提议进行细化,以实现方向与形状预测。
  • IGRs通过从热力图回归2D部件坐标并将其提升至相机坐标系中的3D目标部件坐标来学习。
  • 引入一种新型基于点的表示方法,用于在物体坐标系中建模可见物体表面点,从而实现隐式形状估计。
  • 幻觉模块(Ha)利用可见点云生成未见表面的合理点,提升形状的完整性。
  • 使用掩码头抑制背景点,减少形状重建过程中的噪声。
  • 通过结合检测、方向与形状重建目标的多任务损失进行训练,并引入基于MMD的新指标以衡量形状保真度。

实验结果

研究问题

  • RQ1与直接回归相比,中间几何表示(IGRs)是否能在立体设置下提升3D目标方向估计性能?
  • RQ2所提出的方法是否能泛化至小尺寸及代表性不足的户外目标(如行人和自行车)?
  • RQ3基于点的表示是否能有效重建隐式形状,同时最小化未见表面的幻觉?
  • RQ4与单视角基线相比,立体输入与IGRs的融合在方向估计精度与形状重建方面有何提升?
  • RQ5在真实场景中,该方法对存在噪声的3D边界框提议在多大程度上保持鲁棒性?

主要发现

  • 在KITTI验证集上,当2D检测完美(AP2D=100.00)时,S-3D-RCNN的AOS得分为99.58%,显著优于基线(95.22%)和Deep3DBox(98.48%)。
  • 通过PPCs引入立体输入后,与单视角Ego-Net相比,硬样本的AOS提升了7.43%,证明了多视角聚合的优势。
  • Ha模块将MMDTP从无Ha时的0.027降低至(0,10m]深度范围内的0.0051,证明其在生成合理表面点方面的有效性。
  • 掩码预测使MMDTP平均提升40%,表明背景点抑制能显著提升形状重建质量。
  • 即使在平移噪声增加至±0.2m的情况下,方法仍保持稳定性能,表明对提议质量变化具有鲁棒性。
  • 新指标AP_MMD显示,在IoU > 0.7条件下,Ego-Net++相比Disp R-CNN在AP_MMD上提升了12.5%,验证了所提形状检索评估方法的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。