Skip to main content
QUICK REVIEW

[论文解读] Conf-Net: Toward High-Confidence Dense 3D Point-Cloud with Error-Map Prediction

Hamid Hekmatian, Jingfu Jin|arXiv (Cornell University)|Jul 23, 2019
Advanced Vision and Imaging参考文献 29被引用 9
一句话总结

Conf-Net 提出了一种端到端的深度学习方法,能够从稀疏 LiDAR 数据中联合预测密集深度图和像素级误差图,从而生成高置信度的半稠密三维点云,且 RMSE 显著降低。通过在训练过程中直接学习误差信号,其在无需 RGB 引导的情况下实现了 399mm 的 RMSE——比当前最先进方法低 60%,并能有效扩展至单目深度估计任务。

ABSTRACT

This work proposes a method for depth completion of sparse LiDAR data using a convolutional neural network which can be used to generate semi-dense depth maps and "almost" full 3D point-clouds with significantly lower root mean squared error (RMSE) over state-of-the-art methods. We add an "Error Prediction" unit to our network and present a novel and simple end-to-end method that learns to predict an error-map of depth regression task. An "almost" dense high-confidence/low-variance point-cloud is more valuable for safety-critical applications specifically real-world autonomous driving than a full point-cloud with high error rate and high error variance. Using our predicted error-map, we demonstrate that by up-filling a LiDAR point cloud from 18,000 points to 285,000 points, versus 300,000 points for full depth, we can reduce the RMSE error from 1004 to 399. This error is approximately 60% less than the state-of-the-art and 50% less than the state-of-the-art with RGB guidance (we did not use RGB guidance in our algorithm). In addition to analyzing our results on Kitti depth completion dataset, we also demonstrate the ability of our proposed method to extend to new tasks by deploying our "Error Prediction" unit to improve upon the state-of-the-art for monocular depth estimation. Codes and demo videos are available at http://github.com/hekmak/Conf-net.

研究动机与目标

  • 为面向安全关键的自动驾驶应用,从稀疏 LiDAR 数据中生成高置信度的密集三维点云。
  • 解决在极端稀疏性(超过 95% 数据缺失)下深度补全的高方差与不确定性,尤其是在缺乏 RGB 引导的情况下。
  • 直接预测像素级误差图作为可学习信号,提升不确定性估计能力,并实现基于置信度的深度预测过滤。
  • 证明误差预测模块在其他回归任务(如单目深度估计)中的泛化能力。
  • 提供一种即插即用的不确定性感知深度预测解决方案,对现有网络仅需极少架构修改。

提出的方法

  • 提出一种多任务学习框架,采用类似 U-Net 的编码器-解码器网络,以端到端方式同时预测密集深度图与像素级误差图。
  • 设计一种新型损失函数,将真实深度误差作为直接监督信号引入训练过程,使网络能够直接学习误差估计。
  • 采用基于比例的归一化技术,平衡深度图与误差图的损失,提升训练稳定性与收敛性。
  • 利用预测的误差图过滤低置信度的深度预测结果,从稀疏输入生成高置信度的半稠密三维点云。
  • 通过将损失权重的调参方式替换为提出的基于比例的归一化方法,并引入误差图损失,将误差预测模块扩展至单目深度估计任务。
  • 利用误差图设定置信度阈值,使用户可在点云密度与预测精度之间灵活权衡。

实验结果

研究问题

  • RQ1能否训练一个深度神经网络,在深度补全过程中预测自身的像素级误差图,从而提升不确定性估计?
  • RQ2与使用不确定性或置信度代理信号相比,直接从实际误差信号中学习,是否能带来更准确、更可靠的深度预测?
  • RQ3预测的误差图能否用于生成高置信度的半稠密三维点云,其在准确性和可靠性方面是否优于完整点云方法?
  • RQ4误差预测模块是否能有效迁移至其他深度回归任务(如单目深度估计),而无需对网络架构进行大规模修改?
  • RQ5在 RMSE、MAE 和基于置信度的过滤性能方面,所提方法与最先进方法相比表现如何?

主要发现

  • 当从 18,000 个点上采样至 285,000 个点时,Conf-Net 将 RMSE 从基线稀疏 LiDAR 的 1004mm 降低至 399mm,比无需 RGB 引导的最先进方法低 60%。
  • 在 Kitti 深度补全基准测试中,该方法在无 RGB 引导的情况下实现 300mm 的 RMSE,相比之前最先进方法在精度上提升 50%。
  • 通过设置 200mm 的误差阈值,方法保留了 93.52% 的点云,同时将 RMSE 降低至 468mm,证明了在密度与精度之间实现有效权衡。
  • 误差图预测结果在准确性和上下文语义意义方面均优于间接不确定性估计方法,这在深度补全和单目深度估计任务中均得到验证。
  • 在 NYU Depth 数据集上,将误差预测模块集成到 Alhashim 等人的单目深度模型中后,性能得到提升,在 100mm 阈值下实现 0.365 的 RMSE,优于所有先前方法。
  • 该方法具有高度模块化:仅需修改损失函数,即可将误差图头与损失函数添加至现有网络,而无需像基于置信度的方法那样进行完整重实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。