[论文解读] Advancing Self-supervised Monocular Depth Learning with Sparse LiDAR
本文提出FusionDepth,一种两阶段自监督网络,通过融合稀疏LiDAR与单目图像特征,提升密集单目深度预测性能。通过引入稀疏LiDAR的伪密集表示以及实时RefineNet,该方法在KITTI数据集上相较先前的稀疏LiDAR方法,使单目3D目标检测性能提升超过68%,达到当前最先进水平。
Self-supervised monocular depth prediction provides a cost-effective solution to obtain the 3D location of each pixel. However, the existing approaches usually lead to unsatisfactory accuracy, which is critical for autonomous robots. In this paper, we propose FusionDepth, a novel two-stage network to advance the self-supervised monocular dense depth learning by leveraging low-cost sparse (e.g. 4-beam) LiDAR. Unlike the existing methods that use sparse LiDAR mainly in a manner of time-consuming iterative post-processing, our model fuses monocular image features and sparse LiDAR features to predict initial depth maps. Then, an efficient feed-forward refine network is further designed to correct the errors in these initial depth maps in pseudo-3D space with real-time performance. Extensive experiments show that our proposed model significantly outperforms all the state-of-the-art self-supervised methods, as well as the sparse-LiDAR-based methods on both self-supervised monocular depth prediction and completion tasks. With the accurate dense depth prediction, our model outperforms the state-of-the-art sparse-LiDAR-based method (Pseudo-LiDAR++) by more than 68% for the downstream task monocular 3D object detection on the KITTI Leaderboard. Code is available at https://github.com/AutoAILab/FusionDepth
研究动机与目标
- 解决自监督单目深度预测在动态、遮挡场景下精度较差的问题。
- 利用低成本、稀疏LiDAR(如4束)作为几何先验,避免依赖缓慢的后处理方法。
- 通过高质量的深度预测,提升下游3D感知任务(如单目3D目标检测)的性能。
- 设计一种高效、实时的细化网络,以纠正伪3D空间中的深度误差。
- 建立深度预测质量与下游3D感知性能之间的强关联。
提出的方法
- 该方法采用两阶段框架:首先,特征融合网络将单目图像特征与稀疏LiDAR点的伪密集表示相结合,生成初始深度图。
- 提出一种新颖的伪密集表示(PDR),将稀疏LiDAR点转换为更密集、更适合网络处理的格式,以实现有效的特征融合。
- 训练一种高效、前馈式的RefineNet,以在3D空间中纠正高阶深度误差,实现139 FPS的实时推理。
- 模型通过自监督目标进行端到端训练,损失函数包括光度一致性损失与自车运动估计。
- 该框架在深度预测与补全任务上进行评估,预测的深度图用于生成伪LiDAR点,以支持单目3D目标检测。
- RefineNet在伪3D空间中运行,实现超越2D图像空间的几何上有意义的误差校正。
实验结果
研究问题
- RQ1在特征学习阶段,能否有效融合稀疏LiDAR与单目图像,以提升深度预测精度?
- RQ2两阶段方法(先预测后细化)是否优于端到端的自监督方法,从而获得更优的深度质量?
- RQ3一种实时、前馈式的细化网络能否超越如GDC等迭代式、缓慢的后处理方法,在深度补全任务中表现更优?
- RQ4改进的深度预测在多大程度上能提升下游3D目标检测的性能?
- RQ5该方法在低层次任务与高层次任务上,相较于当前最先进自监督方法与基于稀疏LiDAR的方法,表现如何?
主要发现
- FusionDepth在KITTI单目深度预测基准上达到最先进性能,显著优于现有自监督方法。
- 通过所提出的伪密集表示,模型有效融合稀疏LiDAR与图像特征,显著提升深度补全精度。
- RefineNet在所有语义类别中均减少深度误差,尤其在车辆与行人等移动物体上改善最为显著。
- 在KITTI 3D目标检测基准上,与Pseudo-LiDAR++相比,FusionDepth使汽车类别在AP@0.7指标上提升68.9%。
- 定性对比显示,经优化的深度图可显著提升检测结果,优于真实深度与基线模型。
- RefineNet实现139 FPS的实时推理,适用于自主机器人应用,而基于GDC的方法则速度较慢。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。