Skip to main content
QUICK REVIEW

[论文解读] NeuralField-LDM: Scene Generation with Hierarchical Latent Diffusion Models

Seung Wook Kim, Bradley Brown|arXiv (Cornell University)|Apr 19, 2023
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

NeuralField-LDM 提出了一种分层潜在扩散模型,用于从带有姿态的图像和深度数据生成复杂且高质量的3D真实世界场景。它通过自编码器将场景编码为神经场,将其压缩为多尺度潜在表示(3D 粗粒度、2D 细粒度、1D 全局),并利用分层扩散模型生成新场景,在四个基准数据集上实现了最先进性能,同时支持条件生成、风格迁移和编辑功能。

ABSTRACT

Automatically generating high-quality real world 3D scenes is of enormous interest for applications such as virtual reality and robotics simulation. Towards this goal, we introduce NeuralField-LDM, a generative model capable of synthesizing complex 3D environments. We leverage Latent Diffusion Models that have been successfully utilized for efficient high-quality 2D content creation. We first train a scene auto-encoder to express a set of image and pose pairs as a neural field, represented as density and feature voxel grids that can be projected to produce novel views of the scene. To further compress this representation, we train a latent-autoencoder that maps the voxel grids to a set of latent representations. A hierarchical diffusion model is then fit to the latents to complete the scene generation pipeline. We achieve a substantial improvement over existing state-of-the-art scene generation models. Additionally, we show how NeuralField-LDM can be used for a variety of 3D content creation applications, including conditional scene generation, scene inpainting and scene style manipulation.

研究动机与目标

  • 为解决在无需显式3D真实值的情况下实现可扩展、高保真3D场景生成的挑战。
  • 克服先前3D扩散模型中单向量条件限制的局限性,后者限制了对复杂场景分布的建模能力。
  • 支持多样化3D内容创作应用,如条件生成、风格迁移和场景编辑。
  • 通过利用潜在空间扩散和预训练图像扩散模型的得分蒸馏,提升生成样本的质量与多样性。
  • 开发一种仅使用带姿态的图像和深度图的可扩展流水线,使数据收集更加实际可行。

提出的方法

  • 训练一个场景自编码器,从带姿态的图像与深度图对中将3D场景表示为密度和特征体素网格。
  • 应用潜在自编码器,将体素网格压缩为分层潜在空间:3D 粗粒度、2D 细粒度和1D 全局潜在表示。
  • 在三重潜在表示上训练分层扩散模型,以生成新的3D场景。
  • 使用预训练CLIP编码器进行得分蒸馏采样(SDS),以优化生成的神经场,从而提升视觉质量。
  • 通过在鸟瞰图语义分割图或文本提示上进行条件控制,实现条件生成。
  • 通过潜在空间操作和使用CLIP方向性损失进行微调,支持场景编辑与风格迁移。

实验结果

研究问题

  • RQ1分层潜在扩散模型能否在无需显式3D监督的情况下,有效从2D图像和深度数据生成多样化、高保真的3D场景?
  • RQ2与单一向量条件相比,分层潜在空间分解在建模复杂场景结构方面如何提升3D场景生成的建模能力与质量?
  • RQ3从预训练图像扩散模型中进行得分蒸馏是否能显著提升生成3D场景的视觉保真度?
  • RQ4NeuralField-LDM 在多大程度上能够支持使用语义图或文本提示的条件化场景生成?
  • RQ5该模型能否在3D空间中实现高质量、内容保持的风格迁移与场景编辑?

主要发现

  • NeuralField-LDM 在四个具有挑战性的3D场景生成基准上达到最先进性能,在质量和多样性方面均优于先前方法。
  • 分层潜在空间设计通过分离全局、局部和细粒度特征,实现了对复杂场景结构的更好建模。
  • 使用预训练CLIP模型进行得分蒸馏显著提升了生成场景的视觉质量,尤其在结构和纹理细节方面。
  • 通过鸟瞰图语义分割图进行条件生成,实现了精确、语义引导的场景合成,具备精准的布局控制能力。
  • 通过CLIP方向性损失实现的文本引导风格迁移,可实现快速、泛化性强的风格适配,尽管基于SDS的优化能获得更高品质结果。
  • 通过潜在空间重采样实现的场景编辑,可在保持全局一致性的前提下,实现局部化、内容保持的修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。