Skip to main content
QUICK REVIEW

[论文解读] RenderDiffusion: Image Diffusion for 3D Reconstruction, Inpainting and Generation

Titas Anciukevičius, Zexiang Xu|arXiv (Cornell University)|Nov 17, 2022
Generative Adversarial Networks and Image Synthesis被引用 14
一句话总结

RenderDiffusion 首次提出一种仅在单目 2D 图像上进行训练的 3D 感知扩散模型,采用基于潜在三平面表示的去噪架构与可微渲染,以实现 3D 一致性。该方法支持 3D 重建、3D 感知图像修复以及无条件 3D 生成,在 ShapeNet、CLEVR、FFHQ 和 AFHQ 数据集上表现优异,实现了无需显式 3D 监督的单目 3D 重建最先进性能。

ABSTRACT

Diffusion models currently achieve state-of-the-art performance for both conditional and unconditional image generation. However, so far, image diffusion models do not support tasks required for 3D understanding, such as view-consistent 3D generation or single-view object reconstruction. In this paper, we present RenderDiffusion, the first diffusion model for 3D generation and inference, trained using only monocular 2D supervision. Central to our method is a novel image denoising architecture that generates and renders an intermediate three-dimensional representation of a scene in each denoising step. This enforces a strong inductive structure within the diffusion process, providing a 3D consistent representation while only requiring 2D supervision. The resulting 3D representation can be rendered from any view. We evaluate RenderDiffusion on FFHQ, AFHQ, ShapeNet and CLEVR datasets, showing competitive performance for generation of 3D scenes and inference of 3D scenes from 2D images. Additionally, our diffusion-based approach allows us to use 2D inpainting to edit 3D scenes.

研究动机与目标

  • 通过仅在 2D 图像上进行训练的扩散模型实现 3D 生成与推理,避免对显式 3D 监督的依赖。
  • 通过在去噪过程中嵌入潜在 3D 表示,解决图像扩散模型中的 3D 一致性挑战。
  • 仅通过 2D 图像级别的监督,支持如图像修复与物体插入等 3D 感知编辑任务。
  • 在保持锐利图像质量与高效内存使用的同时,实现高保真度、多样化且视角一致的 3D 场景生成。
  • 证明可通过基于三平面的 3D 归纳偏置,在 2D 去噪过程中隐式学习 3D 一致性。

提出的方法

  • 该模型使用在 2D 噪音图像上操作的去噪 U-Net,并通过潜在三平面表示来建模 3D 几何与外观。
  • 三平面编码器将噪声 2D 图像转换为 3D 感知的潜在表示,随后通过可微体积渲染将其重投影为 2D 图像。
  • 去噪过程被训练为从噪声输入重建干净的 2D 图像,其中 3D 表示确保所有视角下的一致 3D 结构。
  • 该方法利用可微渲染器将梯度反向传播通过 3D 表示,从而实现从 2D 监督端到端训练。
  • 模型在训练时假设可访问相机内参与外参,利用它们将三平面表示对齐至全局 3D 坐标系。
  • 在 3D 感知图像修复中,模型在已知图像区域上进行条件去噪,同时采样遮挡区域,生成合理的 3D 一致补全。

实验结果

研究问题

  • RQ1仅在 2D 图像上进行训练的扩散模型是否能无需显式 3D 监督即学习生成 3D 一致的场景?
  • RQ2结合可微渲染的潜在三平面表示在图像去噪过程中对强制实现 3D 一致性有多有效?
  • RQ32D 扩散模型能否在单目 3D 重建任务中达到与 3D 监督方法相媲美的精度?
  • RQ42D 图像修复能否通过 3D 感知扩散模型扩展为 3D 一致的场景补全?
  • RQ5与仅基于 2D 的扩散模型相比,三平面渲染带来的 3D 归纳偏置是否能提升 3D 生成的泛化能力与多样性?

主要发现

  • RenderDiffusion 在单目 3D 重建方面表现优异,其在 ShapeNet 的三个类别中有两个类别的数据集覆盖度超过 EG3D。
  • 该模型仅从一张 2D 图像即可生成多样化且逼真的 3D 场景,多视角下几何结构一致,并呈现出合理的阴影效果。
  • 使用该模型进行 3D 感知图像修复,可对遮挡的 2D 区域生成多样化且合理的补全结果,即使未在该任务上进行显式训练。
  • 在 FFHQ 与 AFHQ 上,模型生成了 3D 一致且视角可控的图像,但在大方位角角度下出现了一些伪影。
  • 与仅使用 2D 监督训练的最先进单目 3D 重建方法相比,该方法显著提升了重建精度。
  • 该模型证明了可通过基于三平面的 3D 归纳偏置,在 2D 去噪过程中隐式学习 3D 一致性,从而实现从 2D 数据出发的 3D 感知生成与编辑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。