Skip to main content
QUICK REVIEW

[论文解读] Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction

Xinhang Liu, Jiaben Chen|arXiv (Cornell University)|May 24, 2023
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

Deceptive-NeRF 提出了一种新颖的少样本 NeRF 重建框架,通过使用扩散模型生成逼真的伪观测图像(以粗略 NeRF 渲染结果为条件),实现了在稀疏输入下的最先进新视角合成性能,在 Hypersim 和 LLFF 数据集的五视角和十视角设置下,PSNR、SSIM 和 LPIPS 指标均优于现有方法。

ABSTRACT

Novel view synthesis via Neural Radiance Fields (NeRFs) or 3D Gaussian Splatting (3DGS) typically necessitates dense observations with hundreds of input images to circumvent artifacts. We introduce Deceptive-NeRF/3DGS to enhance sparse-view reconstruction with only a limited set of input images, by leveraging a diffusion model pre-trained from multiview datasets. Different from using diffusion priors to regularize representation optimization, our method directly uses diffusion-generated images to train NeRF/3DGS as if they were real input views. Specifically, we propose a deceptive diffusion model turning noisy images rendered from few-view reconstructions into high-quality photorealistic pseudo-observations. To resolve consistency among pseudo-observations and real input views, we develop an uncertainty measure to guide the diffusion model's generation. Our system progressively incorporates diffusion-generated pseudo-observations into the training image sets, ultimately densifying the sparse input observations by 5 to 10 times. Extensive experiments across diverse and challenging datasets validate that our approach outperforms existing state-of-the-art methods and is capable of synthesizing novel views with super-resolution in the few-view setting.

研究动机与目标

  • 解决真实世界用户拍摄数据中极稀疏输入视角下 NeRF 重建质量差的挑战。
  • 克服原始 NeRF 模型需要数百张视角且在稀疏监督下失效的局限性。
  • 不将预训练的 2D 扩散模型用作正则化器,而是用作语义一致、逼真的伪观测图像生成器,以扩充训练数据。
  • 通过引入渐进式训练策略,迭代地利用新生成的伪观测图像逐步优化 NeRF,从而提升重建保真度和泛化能力。
  • 在伪观测图像生成过程中保持多视角一致性与场景语义,避免伪影和幻觉现象。

提出的方法

  • 首先,从稀疏输入图像及其相机位姿中训练一个粗略 NeRF,以生成初始的新视角渲染图像和深度图。
  • 使用一种新颖的欺骗性扩散模型,基于粗略 NeRF 的渲染结果,结合 RGB 和深度输入,合成高保真度的伪观测图像。
  • 该欺骗性扩散模型经过训练,能够生成在感知上逼真且与粗略 NeRF 输出保持语义一致性的图像。
  • 应用渐进式训练策略:在每次迭代中,当前的 NeRF 生成的渲染结果用于生成新的伪观测图像,用于训练下一轮的 NeRF。
  • 在最终的 NeRF 训练中,同时使用真实输入图像和生成的伪观测图像,并通过多视角监督强制实现视角间的一致性。
  • 通过图像字幕和文本反转技术引入文本条件,以改善伪观测图像中的风格与内容对齐。

实验结果

研究问题

  • RQ1扩散模型能否被有效重用于数据生成而非正则化,以在稀疏监督下提升 NeRF 重建质量?
  • RQ2以粗略 NeRF 渲染结果为条件的扩散模型,能否生成保持场景语义和多视角一致性的伪观测图像?
  • RQ3通过迭代使用新生成的伪观测图像逐步优化 NeRF 的渐进式训练策略,是否能优于单步生成方法,从而获得更优的重建质量?
  • RQ4深度条件和多模态文本条件(图像字幕 + 文本反转)在提升生成伪观测图像的真实感和一致性方面有何贡献?
  • RQ5在极端视角稀疏性条件下,该方法在少样本新视角合成任务中,相对于现有最先进方法的性能提升程度如何?

主要发现

  • 在 Hypersim 和 LLFF 数据集上,Deceptive-NeRF 在所有评估指标上均达到最先进性能,20视角设置下的 PSNR 为 22.41,SSIM 为 0.812。
  • 在五视角设置下,Deceptive-NeRF 在 PSNR 和 SSIM 上均取得最高分,LPIPS 排名第二,表明其具有更优的感知质量。
  • 消融实验证实,所有组件——渐进式训练、深度条件、数据增强以及双文本嵌入(字幕 + 文本反转)——对最优性能均不可或缺。
  • 完整模型(含所有组件)的 PSNR 达到 22.41,显著优于无渐进式训练的变体(PSNR 19.90)和无深度条件的变体(PSNR 18.79)。
  • 定性结果表明,与基线方法相比,Deceptive-NeRF 生成的新视角更清晰、细节更丰富,伪影更少,尤其在物体级纹理和几何结构方面表现更优。
  • 该方法即使在仅提供 5 张输入视角的情况下,也能成功合成逼真的新视角,展现出对极端输入稀疏性的强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。