Skip to main content
QUICK REVIEW

[论文解读] Single-Stage Diffusion NeRF: A Unified Approach to 3D Generation and Reconstruction

Hansheng Chen, Jiatao Gu|arXiv (Cornell University)|Apr 13, 2023
Advanced Vision and Imaging被引用 5
一句话总结

SSDNeRF 提出了一种单阶段扩散模型,通过多视角图像联合训练神经辐射场(NeRF)自解码器和3D潜在扩散先验,实现了统一3D生成与重建的端到端学习。该方法在无条件3D生成以及单视角/稀疏视角重建任务中均达到最先进性能,甚至可仅用三张视角图像实现高质量重建。

ABSTRACT

3D-aware image synthesis encompasses a variety of tasks, such as scene generation and novel view synthesis from images. Despite numerous task-specific methods, developing a comprehensive model remains challenging. In this paper, we present SSDNeRF, a unified approach that employs an expressive diffusion model to learn a generalizable prior of neural radiance fields (NeRF) from multi-view images of diverse objects. Previous studies have used two-stage approaches that rely on pretrained NeRFs as real data to train diffusion models. In contrast, we propose a new single-stage training paradigm with an end-to-end objective that jointly optimizes a NeRF auto-decoder and a latent diffusion model, enabling simultaneous 3D reconstruction and prior learning, even from sparsely available views. At test time, we can directly sample the diffusion prior for unconditional generation, or combine it with arbitrary observations of unseen objects for NeRF reconstruction. SSDNeRF demonstrates robust results comparable to or better than leading task-specific methods in unconditional generation and single/sparse-view 3D reconstruction.

研究动机与目标

  • 解决构建统一框架以应对多样化3D任务(如无条件生成与基于图像的重建)的挑战。
  • 克服两阶段训练在扩散NeRF中因稀疏视角下NeRF重建不完美而导致潜在空间噪声的问题。
  • 实现NeRF与扩散模型的端到端联合训练,以协同融合生成与渲染偏差,提升性能。
  • 设计一种推理时指导微调方案,利用学习到的先验实现对任意数量输入视角的灵活3D重建。
  • 在稀疏视角数据(包括仅三张输入视角)上展现鲁棒性能,而先前方法因伪影传播而失效。

提出的方法

  • 提出一种单阶段训练范式,通过统一的端到端目标,联合优化NeRF自解码器权重与潜在扩散模型权重。
  • 采用三平面特征表示进行3D场景编码,实现高效且富有表现力的神经辐射场建模。
  • 直接在从多视角图像提取的场景潜在码上训练3D潜在扩散模型,避免对预训练NeRF的依赖。
  • 在推理阶段引入一种指导微调采样方案,使扩散先验能基于任意输入视角进行条件化,以实现重建。
  • 在训练过程中采用早停策略,以保留更平滑的潜在先验,提升稀疏视角重建的泛化能力。
  • 采用DDIM采样并结合球面线性插值,评估学习到的先验中潜在空间插值的平滑性。

实验结果

研究问题

  • RQ1能否通过单阶段训练范式构建一个统一的3D生成与重建框架,从而避免两阶段训练引入的伪影?
  • RQ2扩散模型在不依赖预训练NeRF的前提下,能在多大程度上直接从稀疏视角多场景数据中学习到清晰且可泛化的3D先验?
  • RQ3学习到的扩散先验在推理阶段对任意数量输入视角的高质量3D重建中,其有效性如何?
  • RQ4与解耦的两阶段训练相比,NeRF与扩散组件的端到端联合优化是否能在稀疏视角数据上带来更好的性能?
  • RQ5扩散模型的潜在空间是否能支持3D场景之间平滑且有意义的插值,从而表明其先验结构良好且具备泛化能力?

主要发现

  • 在SRN Cars数据集的3视角子集上,SSDNeRF实现了19.04 ±1.10的Fréchet Inception Distance(FID)和8.28 ±0.60的Kernel Inception Distance(KID),表明其在无条件3D生成方面具有极强的质量。
  • 在单视角重建任务中,SSDNeRF的LPIPS得分为0.106,优于大多数使用完整训练集的先前方法。
  • 在稀疏到密集的重建任务中,SSDNeRF显著优于采用TV正则化的基线三平面NeRF和CodeNeRF,尤其在低视角场景(1–4视角)中表现更优。
  • 该模型仅用三张输入视角即可成功重建出一致且无伪影的几何结构,而标准的自编码器配合TV正则化在相同条件下则失败。
  • 训练过程中的早停策略保留了更平滑的潜在先验,从而实现了更一致且视觉上更可信的生成3D场景之间的插值。
  • 指导微调采样方案使模型能有效实现从任意数量视角的重建,充分展现了推理阶段学习到的扩散先验的灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。