Skip to main content
QUICK REVIEW

[论文解读] LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation

Jiaxiang Tang, Zhaoxi Chen|arXiv (Cornell University)|Feb 7, 2024
Computer Graphics and Visualization Techniques被引用 4
一句话总结

LGM 提出了一种大规模多视角高斯模型,能够从文本或单视角图像在 5 秒内生成高分辨率 3D 内容,通过非对称 U-Net 预测多视角图像的 3D 高斯,并利用可微渲染进行融合。该方法实现了 512×512 的训练分辨率,最多支持 65,536 个高斯点,显著提升了现有前馈式 3D 生成模型的分辨率与速度。

ABSTRACT

3D content creation has achieved significant progress in terms of both quality and speed. Although current feed-forward models can produce 3D objects in seconds, their resolution is constrained by the intensive computation required during training. In this paper, we introduce Large Multi-View Gaussian Model (LGM), a novel framework designed to generate high-resolution 3D models from text prompts or single-view images. Our key insights are two-fold: 1) 3D Representation: We propose multi-view Gaussian features as an efficient yet powerful representation, which can then be fused together for differentiable rendering. 2) 3D Backbone: We present an asymmetric U-Net as a high-throughput backbone operating on multi-view images, which can be produced from text or single-view image input by leveraging multi-view diffusion models. Extensive experiments demonstrate the high fidelity and efficiency of our approach. Notably, we maintain the fast speed to generate 3D objects within 5 seconds while boosting the training resolution to 512, thereby achieving high-resolution 3D content generation.

研究动机与目标

  • 解决现有 3D 生成模型在训练分辨率低和计算成本高的局限性。
  • 克服基于三平面表示和 Transformer 主干网络在高分辨率 3D 生成中的低效问题。
  • 通过前馈式、端到端可训练的框架,实现在文本或单视角图像输入下快速、高保真度的 3D 生成。
  • 通过数据增强提升模型对真实多视角图像与合成多视角图像之间领域差异的鲁棒性。
  • 为下游应用提供通用的网格提取流程,将生成的 3D 高斯点转换为可使用的多边形网格。

提出的方法

  • 该方法使用多视角高斯特征作为表达能力强且高效的 3D 表示,实现紧凑的场景表示与快速渲染。
  • 采用非对称 U-Net 主干网络处理多视角图像以预测 3D 高斯特征,并在深层网络中引入注意力模块以增强跨视角特征融合。
  • 应用可微渲染对模型进行监督,利用高分辨率新视角进行训练,实现基于图像级别的端到端训练。
  • 模型利用预训练的文本到图像或图像到多视角图像扩散模型,从文本或单张图像生成四张输入视角。
  • 提出两种数据增强策略,以弥合真实 3D 渲染视角与扩散模型生成的多视角图像之间的领域差异。
  • 设计一种通用的网格提取算法,将生成的 3D 高斯点转换为平滑、带纹理的多边形网格,适用于下游应用。

实验结果

研究问题

  • RQ1前馈式 3D 生成模型是否能在保持 5 秒内推理速度的前提下实现 512×512 的高分辨率输出?
  • RQ2与三平面或 NeRF 基础方法相比,采用非对称 U-Net 主干网络的多视角高斯融合在几何与纹理细节保留方面效果如何?
  • RQ3在使用扩散模型生成的合成多视角图像进行训练时,数据增强在多大程度上提升了模型的鲁棒性?
  • RQ4所提方法在文本到 3D 与图像到 3D 生成任务中是否具备高保真度的泛化能力?
  • RQ53D 高斯点能否被有效转换为适合真实世界应用的高质量、带纹理的网格?

主要发现

  • LGM 模型可生成最多 65,536 个高斯点,支持 512×512 的训练分辨率,显著提升了前馈式 3D 生成的分辨率上限。
  • 该模型在约 5 秒内完成 3D 内容生成,在保持高速的同时,将分辨率提升至超越先前前馈模型的水平。
  • 用户研究表明,LGM 生成的 3D 高斯点在图像一致性和整体质量方面优于基线模型,共收集到 20 名志愿者的 600 个有效评分。
  • 消融实验表明,多视角输入显著提升了 3D 几何重建质量,而单视角模型生成的背面区域模糊且不一致。
  • 数据增强显著减少了伪影与浮点噪声,提升了 3D 一致性,即使在多视角图像合成存在领域差异的情况下亦然。
  • 网格提取算法成功将 3D 高斯点转换为平滑、带纹理的网格,实现了与标准 3D 工作流的兼容性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。