[论文解读] Dense Depth Posterior (DDP) from Single Image and Sparse Range
该论文提出Dense Depth Posterior(DDP),一种深度学习框架,能够从单张RGB图像和稀疏激光雷达点云中估计密集深度图的完整后验分布。通过结合条件先验网络(CPN)与稀疏测量的似然建模,DDP在KITTI和NYUv2基准上的监督与无监督深度补全任务中均达到最先进性能,显著提升了准确率与鲁棒性,尤其在稀疏深度密度较低时表现更优。
We present a deep learning system to infer the posterior distribution of a dense depth map associated with an image, by exploiting sparse range measurements, for instance from a lidar. While the lidar may provide a depth value for a small percentage of the pixels, we exploit regularities reflected in the training set to complete the map so as to have a probability over depth for each pixel in the image. We exploit a Conditional Prior Network, that allows associating a probability to each depth value given an image, and combine it with a likelihood term that uses the sparse measurements. Optionally we can also exploit the availability of stereo during training, but in any case only require a single image and a sparse point cloud at run-time. We test our approach on both unsupervised and supervised depth completion using the KITTI benchmark, and improve the state-of-the-art in both.
研究动机与目标
- 估计密集深度图的完整后验分布,而非依赖点估计,以实现不确定性感知的深度补全。
- 通过利用大规模图像-深度对数据集学习到的场景规律作为先验,提升深度补全的准确性。
- 仅在推理时使用单张图像和稀疏深度测量,无需立体视觉或额外传感器,实现鲁棒的深度补全。
- 通过学习的先验建模场景拓扑与深度不连续性,减少伪影并提升几何一致性。
- 在监督与无监督深度补全设置中均实现最先进性能。
提出的方法
- 该方法使用条件先验网络(CPN)建模条件概率 $ P(d|I, \mathcal{D}) $,其中 $ d $ 为密集深度图,$ I $ 为输入图像,$ \mathcal{D} $ 为图像-深度对的训练数据集。
- 将CPN先验与似然项 $ P(z|d) $ 结合,后者建模在假设深度图 $ d $ 下观测到稀疏激光雷达测量 $ z $ 的概率,从而计算完整后验 $ P(d|I,z) \propto P(z|d)P_{\mathcal{D}}(d|I) $。
- 似然项结合了光度一致性(通过SSIM)与深度一致性,采用可微损失函数,对齐扭曲图像并惩罚深度不一致性。
- 网络架构通过两条分支分别处理RGB图像与稀疏深度图,随后在较深层融合特征,生成密集深度预测。
- 模型通过结合无监督与监督损失端到端训练,包括光度、平滑性与深度一致性项。
- 训练期间可选择性地利用立体数据,但推理时仅需单张图像与稀疏深度,使其适用于实际部署。
实验结果
研究问题
- RQ1深度学习模型能否从单张图像与稀疏激光雷达测量中估计密集深度图的完整后验分布,而非仅输出点估计?
- RQ2从大规模图像-深度对数据集中学习到的场景规律,如何提升深度补全的准确性并减少伪影?
- RQ3所提方法在监督与无监督深度补全设置中,相较于现有最先进方法,性能提升程度如何?
- RQ4随着稀疏深度密度降低,性能如何退化?模型在极低密度下是否仍保持鲁棒性?
- RQ5与仅依赖图像或深度特征的方法相比,使用条件先验网络是否能显著提升深度补全性能?
主要发现
- 在KITTI基准上,DDP在1.5%稀疏深度密度下实现测试RMSE为0.521、AbsRel为0.122,在监督与无监督设置中均优于先前方法。
- 在NYUv2数据集上,模型在6%稀疏深度密度下实现RMSE为1.391、AbsRel为0.452,即使在输入密度较低时也表现出色。
- 消融实验表明,使用CPN作为先验显著提升性能,单目设置下iRMSE从4.07降至3.67,优于基线方法[20]。
- 通过引入更精细的场景先验以尊重图像拓扑与深度不连续性,模型有效减少了先前方法中常见的“O”形孔洞等几何伪影。
- 尽管采用双分支融合结构,模型仅使用约18.8M参数,显著少于最先进方法[20]的约27.8M参数,体现出高参数效率。
- 即使在极低稀疏深度密度(如0.01%)下,模型仍保持强性能,NYUv2上RMSE达3.829,表明对稀疏输入具有高度鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。