Skip to main content
QUICK REVIEW

[论文解读] Disp R-CNN: Stereo 3D Object Detection via Shape Prior Guided Instance Disparity Estimation

Jiaming Sun, Linghao Chen|arXiv (Cornell University)|Apr 7, 2020
Advanced Vision and Imaging参考文献 33被引用 15
一句话总结

该论文提出Disp R-CNN,一种立体3D目标检测框架,通过在2D目标提议区域内估计实例级视差而非全图视差,提升了准确率与速度。通过利用统计形状模型生成密集视差伪真值(无需LiDAR),即使在训练过程中无LiDAR监督,也实现了比当前最先进方法高20%的平均精度。

ABSTRACT

In this paper, we propose a novel system named Disp R-CNN for 3D object detection from stereo images. Many recent works solve this problem by first recovering a point cloud with disparity estimation and then apply a 3D detector. The disparity map is computed for the entire image, which is costly and fails to leverage category-specific prior. In contrast, we design an instance disparity estimation network (iDispNet) that predicts disparity only for pixels on objects of interest and learns a category-specific shape prior for more accurate disparity estimation. To address the challenge from scarcity of disparity annotation in training, we propose to use a statistical shape model to generate dense disparity pseudo-ground-truth without the need of LiDAR point clouds, which makes our system more widely applicable. Experiments on the KITTI dataset show that, even when LiDAR ground-truth is not available at training time, Disp R-CNN achieves competitive performance and outperforms previous state-of-the-art methods by 20% in terms of average precision.

研究动机与目标

  • 解决立体3D目标检测中全图视差估计效率低、精度差的问题。
  • 克服KITTI等真实世界数据集中密集视差标注稀缺的问题。
  • 通过使用类别特定的形状先验聚焦前景目标,提升视差估计精度,从而提高3D检测性能。
  • 通过从CAD模型生成合成视差伪真值,实现在无LiDAR真值监督下的有效训练。
  • 通过仅对目标区域进行视差估计,降低计算成本。

提出的方法

  • 提出一种仅在2D目标提议区域(RoIs)内预测视差的实例视差估计网络(iDispNet),提升关注度与效率。
  • 引入基于PCA的统计形状模型作为形状先验,通过拟合CAD模型实现高精度的实例级视差预测。
  • 开发了一套伪真值生成流程,从统计形状模型重建3D物体网格,并渲染密集视差图用于监督。
  • 利用生成的伪真值监督iDispNet的训练,实现在无真实LiDAR标注情况下的高质量视差估计。
  • 将iDispNet集成到端到端3D检测流程中:2D检测 → 实例视差估计 → 从点云回归3D边界框。
  • 应用几何约束与网格拟合,确保伪真值生成过程中形状重建的真实性。

实验结果

研究问题

  • RQ1与全图视差估计相比,实例级视差估计是否能提升3D目标检测的准确率?
  • RQ2统计形状模型能否在无LiDAR的情况下生成可靠的用于训练的伪真值视差?
  • RQ3形状先验引导是否能提升在低纹理或复杂表面区域(如车辆)的视差估计性能?
  • RQ4所提方法是否能在无LiDAR监督的训练过程中实现最先进性能?
  • RQ5与现有立体3D检测流水线相比,该方法在推理速度上表现如何?

主要发现

  • 在KITTI 3D检测基准上,Disp R-CNN实现了47%的平均精度,当训练时未使用LiDAR监督时,相比之前SOTA方法高出20%。
  • 在伪真值监督下,iDispNet的视差与深度RMSE低于全帧方法(如PSMNet和GA-Net),尤其在对象级误差指标上表现更优。
  • 实例级视差估计将单张图像的推理时间降低至0.425秒,由于搜索空间更小、计算量更低,优于大多数先前的立体方法。
  • 定性结果表明,iDispNet生成的视差图更平滑、更准确,且物体边界更清晰,优于全帧方法。
  • 失败案例主要源于远距离物体、严重遮挡或统计形状模型中未充分表示的异常形状。
  • 消融实验表明,实例级设计与伪真值监督对性能提升均至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。