Skip to main content
QUICK REVIEW

[论文解读] Dense Depth Priors for Neural Radiance Fields from Sparse Input Views

Barbara Roessle, Jonathan T. Barron|arXiv (Cornell University)|Dec 6, 2021
Advanced Vision and Imaging被引用 16
一句话总结

本文提出了一种数据高效的方法,通过仅使用18–36张输入图像,在房间尺度场景中实现神经辐射场(NeRF)的视图合成,该方法利用从稀疏SfM重建中获得的密集深度先验。通过采用带有不确定性估计的深度补全网络增强这些稀疏深度,从而引导NeRF优化,生成比基线NeRF或仅使用稀疏深度的方法更高质量的新视图和更精确的深度图。

ABSTRACT

Neural radiance fields (NeRF) encode a scene into a neural representation that enables photo-realistic rendering of novel views. However, a successful reconstruction from RGB images requires a large number of input views taken under static conditions - typically up to a few hundred images for room-size scenes. Our method aims to synthesize novel views of whole rooms from an order of magnitude fewer images. To this end, we leverage dense depth priors in order to constrain the NeRF optimization. First, we take advantage of the sparse depth data that is freely available from the structure from motion (SfM) preprocessing step used to estimate camera poses. Second, we use depth completion to convert these sparse points into dense depth maps and uncertainty estimates, which are used to guide NeRF optimization. Our method enables data-efficient novel view synthesis on challenging indoor scenes, using as few as 18 images for an entire scene.

研究动机与目标

  • 在仅使用标准NeRF所需图像数量的显著更少输入图像下,实现房间尺度场景中的高保真新视图合成。
  • 解决室内场景中因纹理缺失、视图重叠度低和色彩不一致等问题而阻碍NeRF性能的挑战。
  • 通过利用从稀疏SfM重建中获得的密集深度先验,改进NeRF优化,且无需额外的深度传感器。
  • 将不确定性估计融入深度先验,以更稳健地引导在模糊或低可见区域的NeRF优化。
  • 在保持新视图合成中几何和光度一致性的同时,减少对大量输入视图的依赖。

提出的方法

  • 利用结构从运动(SfM)生成的稀疏深度点作为相机位姿估计的免费副产品,用于输入图像。
  • 采用深度补全网络将稀疏SfM深度点转换为带有像素级不确定性估计的密集深度图。
  • 将密集深度图及其不确定性作为监督信号整合到NeRF优化中,以正则化场景几何和外观。
  • 在深度监督中应用可微分的高斯噪声损失(GNLL),以提升密度和深度预测的清晰度。
  • 为每张相机引入潜在码以建模视角依赖效应,并确保新视图间颜色的一致性。
  • 通过结合RGB重建、带不确定性加权的深度监督以及用于深度一致性的GNLL的多任务损失来优化NeRF。

实验结果

研究问题

  • RQ1从稀疏SfM重建中获得的密集深度先验是否能显著提升在低图像数量条件下的NeRF性能?
  • RQ2在纹理缺失或观测不足的区域,不确定性感知的深度监督如何影响NeRF优化?
  • RQ3深度补全网络在多样化室内场景中的泛化能力如何,以支持数据高效的NeRF训练?
  • RQ4在深度先验中引入不确定性是否能减少NeRF输出中的伪影(如'浮动物体')和色彩不一致?
  • RQ5一个预训练的单一深度先验网络是否能实现仅用少量输入图像在多个房间尺度场景中高质量的视图合成?

主要发现

  • 该方法在ScanNet上使用仅18–36张输入图像时达到20.96的PSNR,在Matterport3D上达到18.33,显著优于标准NeRF。
  • 若省略深度补全,ScanNet上的PSNR下降至20.09,表明密集深度先验对性能至关重要。
  • 若去除不确定性监督,将出现明显的伪影(如边缘错误和重复现象),ScanNet上的RMSE上升至0.308。
  • 若将GNLL替换为MSE作为深度损失,密度分布会变得模糊,尤其是在切向视图方向,ScanNet上的RMSE上升至0.312。
  • 若省略潜在码,不同视图间会出现色彩偏移和亮度不匹配,ScanNet上的RMSE上升至0.293。
  • 消融研究证实,所有组件——补全、不确定性、GNLL和潜在码——均对提升图像质量和深度准确性有贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。