[论文解读] NerfingMVS: Guided Optimization of Neural Radiance Fields for Indoor Multi-view Stereo
本文提出NerfingMVS,一种新颖的多视角深度估计方法,通过使用场景自适应的单目深度先验来指导神经辐射场(NeRF)优化,以克服室内场景中的形状-辐射度模糊性。通过在稀疏SfM+MVS重建结果上微调深度网络,并利用其预测结果约束NeRF的体素渲染采样过程,该方法在深度估计精度和视图合成质量方面均达到最先进水平,优于基于匹配对应关系和标准NeRF优化的方法。
In this work, we present a new multi-view depth estimation method that utilizes both conventional reconstruction and learning-based priors over the recently proposed neural radiance fields (NeRF). Unlike existing neural network based optimization method that relies on estimated correspondences, our method directly optimizes over implicit volumes, eliminating the challenging step of matching pixels in indoor scenes. The key to our approach is to utilize the learning-based priors to guide the optimization process of NeRF. Our system firstly adapts a monocular depth network over the target scene by finetuning on its sparse SfM+MVS reconstruction from COLMAP. Then, we show that the shape-radiance ambiguity of NeRF still exists in indoor environments and propose to address the issue by employing the adapted depth priors to monitor the sampling process of volume rendering. Finally, a per-pixel confidence map acquired by error computation on the rendered image can be used to further improve the depth quality. Experiments show that our proposed framework significantly outperforms state-of-the-art methods on indoor scenes, with surprising findings presented on the effectiveness of correspondence-based optimization and NeRF-based optimization over the adapted depth priors. In addition, we show that the guided optimization scheme does not sacrifice the original synthesis capability of neural radiance fields, improving the rendering quality on both seen and novel views. Code is available at https://github.com/weiyithu/NerfingMVS.
研究动机与目标
- 为解决基于NeRF的室内场景深度估计中存在的形状-辐射度模糊性问题,该问题限制了几何精度。
- 通过将基于学习的深度先验直接整合到NeRF优化中,改善多视角深度估计,避免依赖不可靠的对应匹配。
- 证明直接在NeRF体素上进行优化并结合深度先验,可优于基于对应关系的优化方法,与先前假设相反。
- 通过利用传统的SfM+MVS重建作为监督信号,提升深度估计和新视角合成的质量。
- 表明自适应深度先验可在不牺牲合成能力的前提下,提升NeRF在已见视图和新视图上的渲染保真度。
提出的方法
- 在COLMAP生成的目标场景稀疏SfM+MVS重建结果上微调单目深度网络,生成场景特定的深度先验。
- 利用自适应深度先验指导NeRF体素渲染过程中的采样,减少几何与辐射度之间的模糊性。
- 通过渲染图像与真实RGB图像之间的光度误差构建逐像素置信度图,以优化深度预测。
- 在隐式3D体素上直接进行优化,而非依赖估计的对应关系或重投影损失。
- 应用后处理过滤步骤,利用置信度图抑制不可靠预测,提升深度图质量。
- 采用自适应采样边界(α_l 和 α_h),在采样多样性与精度之间取得平衡,提升优化稳定性。
实验结果
研究问题
- RQ1尽管存在固有的形状-辐射度模糊性,基于学习的深度先验是否能显著提升室内场景中基于NeRF的深度估计?
- RQ2在室内多视角立体(MVS)设置下,直接在NeRF体素上结合深度先验进行优化,是否优于基于对应关系的优化框架?
- RQ3将传统SfM+MVS重建整合是否能同时提升NeRF的深度估计与新视角合成质量?
- RQ4为何在室内场景中,将基于对应关系的优化应用于自适应深度先验会导致性能下降?
- RQ5在多大程度上,引导式NeRF优化能提升已见视图与新视图上的渲染质量?
主要发现
- NerfingMVS在室内多视角深度估计基准测试中达到最先进性能,在ScanNet数据集上PSNR为30.55,SSIM为0.948。
- 该方法在所有测试场景中显著优于NeRF(PSNR: 29.19,SSIM: 0.928)及其他SOTA方法如NSVF和SVS。
- 引导式优化提升了NeRF在已见视图上的视图合成质量,PSNR达31.55,SSIM达0.942,优于原始NeRF(PSNR: 28.62,SSIM: 0.909)。
- 出人意料的是,将基于对应关系的优化应用于自适应深度先验会降低性能,表明当对应关系在室内场景中不准确时,此类方法不可靠。
- 自适应采样边界(α_l 和 α_h)通过在采样多样性与精度之间取得平衡,避免采样过度集中或随机,从而带来性能提升。
- 该引导优化方案在保持NeRF原始合成能力的同时提升了几何精度,证明了将传统重建方法与神经隐式表示相结合的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。