[论文解读] 3dDepthNet: Point Cloud Guided Depth Completion Network for Sparse Depth and Single Color Image
3dDepthNet 提出了一种新颖的3D到2D的粗到精深度补全网络,首先通过LiDAR补全网络在3D空间中完成点云,然后利用改进的编码器-解码器结构融合密集3D投影、稀疏深度和RGB输入,实现高精度、平滑的密集深度预测。该方法在KITTI数据集上实现了最先进性能,并对稀疏性表现出优异的鲁棒性。
In this paper, we propose an end-to-end deep learning network named 3dDepthNet, which produces an accurate dense depth image from a single pair of sparse LiDAR depth and color image for robotics and autonomous driving tasks. Based on the dimensional nature of depth images, our network offers a novel 3D-to-2D coarse-to-fine dual densification design that is both accurate and lightweight. Depth densification is first performed in 3D space via point cloud completion, followed by a specially designed encoder-decoder structure that utilizes the projected dense depth from 3D completion and the original RGB-D images to perform 2D image completion. Experiments on the KITTI dataset show our network achieves state-of-art accuracy while being more efficient. Ablation and generalization tests prove that each module in our network has positive influences on the final results, and furthermore, our network is resilient to even sparser depth.
研究动机与目标
- 为解决在机器人和自动驾驶中从稀疏LiDAR扫描和单色图像生成密集、平滑深度图的挑战。
- 克服稀疏深度与RGB数据之间模态错位和特征不一致的局限。
- 通过新颖的3D到2D的致密化流水线,利用3D几何结构提升深度补全的精度和效率。
- 增强对极端稀疏深度输入的鲁棒性,实现在高度稀疏LiDAR数据上的可靠性能。
- 提供具有几何意义、可学习的补全过程,以保持深度连续性和物体边界。
提出的方法
- 该网络采用两阶段的3D到2D的粗到精致密化流水线:首先在3D空间中完成点云,然后在2D图像空间中优化深度。
- LiDAR补全网络利用局部几何和全局上下文信息,对稀疏LiDAR点进行几何引导的补丁化与调整,生成密集3D点云。
- 深度补全网络采用改进的编码器-解码器架构,通过双深度和RGB-D输入通道融合来自3D补全的投影密集深度、原始稀疏深度和RGB图像。
- 网络采用端到端训练,结合L1损失和光滑L1损失的多任务损失函数进行深度预测。
- 方法引入基于坐标的特征编码,以保留空间关系并提升补全过程中的几何一致性。
- 设计通过避免简单的拼接操作,有效实现跨模态的特征融合,从而避免深度与颜色之间单位和尺度一致性的破坏。
实验结果
研究问题
- RQ1与纯2D方法相比,3D点云补全是否能提升深度补全的精度和鲁棒性?
- RQ23D到2D的粗到精致密化流水线与直接2D图像补全相比,在性能和效率方面表现如何?
- RQ3该网络在极低稀疏度输入(如1/256采样率)下,其泛化能力有多强?
- RQ4几何上有意义的3D补全是否能增强边界保持并减少最终深度图中的伪影?
- RQ5该网络如何处理3D到2D投影中的穿透问题,即远处物体投影穿过近处物体的情况?
主要发现
- 3dDepthNet 在KITTI验证集上实现了最先进性能,RMSE为693.23,iRMSE为208.96,优于先前方法。
- 消融实验表明,LiDAR补全网络和深度补全网络均对最终性能有正向贡献,完整模型表现最佳。
- 该网络在更稀疏输入下泛化能力出色,在1/16、1/64和1/256采样率下均优于其他方法,展现出对极端稀疏性的强鲁棒性。
- LiDAR补全网络中的补丁化与几何调整机制实现了有意义的3D补全,从而提升了下游2D优化的效果。
- 深度补全网络有效缓解了投影深度图中的穿透问题,学习到抑制远处物体带来的虚假内点。
- 该模型比先前的最先进方法更高效,参数量为742.28K,单张图像推理时间为2.52ms。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。