[论文解读] Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction
Deceptive-NeRF 提出了一种新颖的少样本 NeRF 重建框架,通过使用扩散模型生成逼真的伪观测图像(以粗略 NeRF 渲染结果为条件),实现了在稀疏输入下的最先进新视角合成性能,在 Hypersim 和 LLFF 数据集的五视角和十视角设置下,PSNR、SSIM 和 LPIPS 指标均优于现有方法。
Novel view synthesis via Neural Radiance Fields (NeRFs) or 3D Gaussian Splatting (3DGS) typically necessitates dense observations with hundreds of input images to circumvent artifacts. We introduce Deceptive-NeRF/3DGS to enhance sparse-view reconstruction with only a limited set of input images, by leveraging a diffusion model pre-trained from multiview datasets. Different from using diffusion priors to regularize representation optimization, our method directly uses diffusion-generated images to train NeRF/3DGS as if they were real input views. Specifically, we propose a deceptive diffusion model turning noisy images rendered from few-view reconstructions into high-quality photorealistic pseudo-observations. To resolve consistency among pseudo-observations and real input views, we develop an uncertainty measure to guide the diffusion model's generation. Our system progressively incorporates diffusion-generated pseudo-observations into the training image sets, ultimately densifying the sparse input observations by 5 to 10 times. Extensive experiments across diverse and challenging datasets validate that our approach outperforms existing state-of-the-art methods and is capable of synthesizing novel views with super-resolution in the few-view setting.
研究动机与目标
- 解决真实世界用户拍摄数据中极稀疏输入视角下 NeRF 重建质量差的挑战。
- 克服原始 NeRF 模型需要数百张视角且在稀疏监督下失效的局限性。
- 不将预训练的 2D 扩散模型用作正则化器,而是用作语义一致、逼真的伪观测图像生成器,以扩充训练数据。
- 通过引入渐进式训练策略,迭代地利用新生成的伪观测图像逐步优化 NeRF,从而提升重建保真度和泛化能力。
- 在伪观测图像生成过程中保持多视角一致性与场景语义,避免伪影和幻觉现象。
提出的方法
- 首先,从稀疏输入图像及其相机位姿中训练一个粗略 NeRF,以生成初始的新视角渲染图像和深度图。
- 使用一种新颖的欺骗性扩散模型,基于粗略 NeRF 的渲染结果,结合 RGB 和深度输入,合成高保真度的伪观测图像。
- 该欺骗性扩散模型经过训练,能够生成在感知上逼真且与粗略 NeRF 输出保持语义一致性的图像。
- 应用渐进式训练策略:在每次迭代中,当前的 NeRF 生成的渲染结果用于生成新的伪观测图像,用于训练下一轮的 NeRF。
- 在最终的 NeRF 训练中,同时使用真实输入图像和生成的伪观测图像,并通过多视角监督强制实现视角间的一致性。
- 通过图像字幕和文本反转技术引入文本条件,以改善伪观测图像中的风格与内容对齐。
实验结果
研究问题
- RQ1扩散模型能否被有效重用于数据生成而非正则化,以在稀疏监督下提升 NeRF 重建质量?
- RQ2以粗略 NeRF 渲染结果为条件的扩散模型,能否生成保持场景语义和多视角一致性的伪观测图像?
- RQ3通过迭代使用新生成的伪观测图像逐步优化 NeRF 的渐进式训练策略,是否能优于单步生成方法,从而获得更优的重建质量?
- RQ4深度条件和多模态文本条件(图像字幕 + 文本反转)在提升生成伪观测图像的真实感和一致性方面有何贡献?
- RQ5在极端视角稀疏性条件下,该方法在少样本新视角合成任务中,相对于现有最先进方法的性能提升程度如何?
主要发现
- 在 Hypersim 和 LLFF 数据集上,Deceptive-NeRF 在所有评估指标上均达到最先进性能,20视角设置下的 PSNR 为 22.41,SSIM 为 0.812。
- 在五视角设置下,Deceptive-NeRF 在 PSNR 和 SSIM 上均取得最高分,LPIPS 排名第二,表明其具有更优的感知质量。
- 消融实验证实,所有组件——渐进式训练、深度条件、数据增强以及双文本嵌入(字幕 + 文本反转)——对最优性能均不可或缺。
- 完整模型(含所有组件)的 PSNR 达到 22.41,显著优于无渐进式训练的变体(PSNR 19.90)和无深度条件的变体(PSNR 18.79)。
- 定性结果表明,与基线方法相比,Deceptive-NeRF 生成的新视角更清晰、细节更丰富,伪影更少,尤其在物体级纹理和几何结构方面表现更优。
- 该方法即使在仅提供 5 张输入视角的情况下,也能成功合成逼真的新视角,展现出对极端输入稀疏性的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。