Skip to main content
QUICK REVIEW

[论文解读] ConsistentNeRF: Enhancing Neural Radiance Fields with 3D Consistency for Sparse View Synthesis

Shoukang Hu, Kaichen Zhou|arXiv (Cornell University)|May 18, 2023
Advanced Vision and Imaging被引用 6
一句话总结

ConsistentNeRF 通过利用基于深度的几何信息和深度不变损失,同时强制执行多视角与单视角 3D 一致性,增强了稀疏视角合成的神经辐射场,在 DTU、LLFF 和 NeRF Synthetic 基准测试中,PSNR 最高提升 94%,SSIM 提升 76%,LPIPS 降低 31%。

ABSTRACT

Neural Radiance Fields (NeRF) has demonstrated remarkable 3D reconstruction capabilities with dense view images. However, its performance significantly deteriorates under sparse view settings. We observe that learning the 3D consistency of pixels among different views is crucial for improving reconstruction quality in such cases. In this paper, we propose ConsistentNeRF, a method that leverages depth information to regularize both multi-view and single-view 3D consistency among pixels. Specifically, ConsistentNeRF employs depth-derived geometry information and a depth-invariant loss to concentrate on pixels that exhibit 3D correspondence and maintain consistent depth relationships. Extensive experiments on recent representative works reveal that our approach can considerably enhance model performance in sparse view conditions, achieving improvements of up to 94% in PSNR, 76% in SSIM, and 31% in LPIPS compared to the vanilla baselines across various benchmarks, including DTU, NeRF Synthetic, and LLFF.

研究动机与目标

  • 解决 NeRF 在稀疏视角设置下因监督信号不足和 3D 一致性学习能力差而导致的性能退化问题。
  • 通过显式建模 NeRF 优化过程中的多视角与单视角 3D 一致性,提升重建质量。
  • 克服先前方法仅关注像素级颜色或深度的局限,整合跨视角的几何一致性。
  • 通过深度监督和一致性正则化,在低视角数量条件下实现鲁棒的新型视角合成。
  • 在 DTU、LLFF 和 NeRF Synthetic 等多样化基准上实现最先进性能,且网络架构改动极小。

提出的方法

  • 利用预训练的 MiDas 模型预测深度,推导多视角 3D 对应掩码,识别在多视角下满足几何一致性的像素。
  • 应用基于掩码的损失函数,为在多视角中具有稳定 3D 投影的像素分配更高的训练损失权重,突出几何一致区域。
  • 引入深度不变损失函数,通过强制局部图像块内深度关系的一致性,正则化单视角 3D 一致性。
  • 利用基于深度的几何约束稳定优化过程,防止在稀疏视角设置下的过拟合。
  • 在统一的训练目标中结合多视角与单视角一致性正则化,提升泛化能力与细节保留效果。
  • 通过在 0 到 1 之间使用均匀分布初始化 MLP 偏置,稳定训练过程,并提升低数据场景下的泛化能力。

实验结果

研究问题

  • RQ1显式建模多视角 3D 一致性是否能提升 NeRF 在稀疏视角设置下的性能?
  • RQ2通过深度不变损失引入单视角 3D 一致性,对重建质量与泛化能力有何影响?
  • RQ3结合多视角与单视角 3D 一致性在多大程度上优于现有基于深度正则化的 NeRF 方法?
  • RQ4在训练视角有限的情况下,基于深度的几何信息是否能有效引导 NeRF 优化?
  • RQ5强制执行 3D 一致性是否能带来更好的泛化能力,特别是在远离训练视角的视图中?

主要发现

  • 在 DTU 数据集的 3 视角设置下,ConsistentNeRF 相较于原始 NeRF,PSNR 最高提升 94%。
  • 该方法在多个基准上将 SSIM 提升最高达 76%,LPIPS 降低 31%,表明其在感知质量与细节保留方面表现更优。
  • 同时引入多视角与单视角 3D 一致性正则化可获得最佳性能,消融实验证实了两种组件的互补优势。
  • ConsistentNeRF 生成的图像更清晰,光照与几何更准确,在视觉质量上优于 MVSNeRF、GeoNeRF 和 ENeRF,尤其在远距离目标视角中表现更优。
  • 该方法在 DTU、LLFF 和 NeRF Synthetic 等多样化数据集上均表现出良好泛化能力,对不同场景复杂度与视角密度具有鲁棒性。
  • 通过修改 MLP 偏置初始化策略,实现了稳定训练与泛化能力提升,有效防止优化失败并减少稀疏设置下的过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。