Skip to main content
QUICK REVIEW

[论文解读] CLAY: A Controllable Large-scale Generative Model for Creating High-quality 3D Assets

Longwen Zhang, Ziyu Wang|arXiv (Cornell University)|May 30, 2024
Advanced Data Storage Technologies被引用 4
一句话总结

CLAY 是一个参数量达15亿的3D原生生成模型,通过多分辨率VAE和潜在扩散Transformer,利用文本、图像或3D原始体素实现高保真度、可控制的3D资产生成。在文本到3D和图像到3D任务的用户研究中,其几何质量优于先前方法78.9%,外观质量优于85.4%,达到当前最先进水平。

ABSTRACT

In the realm of digital creativity, our potential to craft intricate 3D worlds from imagination is often hampered by the limitations of existing digital tools, which demand extensive expertise and efforts. To narrow this disparity, we introduce CLAY, a 3D geometry and material generator designed to effortlessly transform human imagination into intricate 3D digital structures. CLAY supports classic text or image inputs as well as 3D-aware controls from diverse primitives (multi-view images, voxels, bounding boxes, point clouds, implicit representations, etc). At its core is a large-scale generative model composed of a multi-resolution Variational Autoencoder (VAE) and a minimalistic latent Diffusion Transformer (DiT), to extract rich 3D priors directly from a diverse range of 3D geometries. Specifically, it adopts neural fields to represent continuous and complete surfaces and uses a geometry generative module with pure transformer blocks in latent space. We present a progressive training scheme to train CLAY on an ultra large 3D model dataset obtained through a carefully designed processing pipeline, resulting in a 3D native geometry generator with 1.5 billion parameters. For appearance generation, CLAY sets out to produce physically-based rendering (PBR) textures by employing a multi-view material diffusion model that can generate 2K resolution textures with diffuse, roughness, and metallic modalities. We demonstrate using CLAY for a range of controllable 3D asset creations, from sketchy conceptual designs to production ready assets with intricate details. Even first time users can easily use CLAY to bring their vivid 3D imaginations to life, unleashing unlimited creativity.

研究动机与目标

  • 通过实现轻松、高保真度的3D资产生成,弥合人类想象力与数字3D创作之间的鸿沟。
  • 克服现有3D生成工具对专业知识和人工劳动的高要求。
  • 开发一种可扩展的、原生3D的生成模型,能够以高几何与材质保真度处理多种模态(文本、图像、3D原始体素)。
  • 建立大规模、高质量的3D数据集与训练流程,以支持可扩展的3D生成建模。
  • 使初学者和专家均能以极低的投入生成复杂、可投入生产的3D资产。

提出的方法

  • CLAY 使用多分辨率变分自编码器(VAE)从多样化3D几何体中提取分层3D先验,实现高效的潜在空间表征。
  • 在潜在空间中采用轻量化潜在扩散Transformer(DiT),以生成连续、完整的3D表面,实现高几何保真度。
  • 采用渐进式训练方案,高效地在源自经筛选、标准化处理流程的超大规模3D数据集上扩展CLAY。
  • 在外观生成方面,CLAY 使用多视角材质扩散模型,生成2K分辨率的PBR材质贴图,涵盖漫反射、粗糙度和金属度模态。
  • 模型支持多种模态控制输入,包括文本、图像、多视角图像、体素、边界框、点云和隐式表示。
  • 基于GPT-4V的自动标注系统提升了训练数据流程中的数据效率与一致性。

实验结果

研究问题

  • RQ1大规模、原生3D的生成模型是否能在多种输入模态下实现高保真度的几何与材质生成?
  • RQ2与基于2D的方法或直接3D优化方法相比,采用多分辨率VAE的潜在扩散Transformer如何提升3D生成质量?
  • RQ3在仅使用文本输入的情况下,CLAY在生成复杂组合3D对象(如“一只老虎骑着摩托车”)方面具备多大程度的泛化能力?
  • RQ4在文本到3D和图像到3D任务中,CLAY在几何与外观质量方面与当前最先进模型相比表现如何?
  • RQ5大规模、经筛选的3D数据集与渐进式训练方案对模型可扩展性与生成质量有何影响?

主要发现

  • 在文本到3D生成任务中,CLAY在几何质量上的用户偏好得分为78.9%,显著优于第二名方法RichDreamer(后者需约2小时优化,而CLAY仅需约45秒)。
  • 在图像到3D生成任务中,CLAY在几何质量上的用户偏好得分为91.2%,在外观质量上为85.4%,展现出卓越的性能与速度。
  • CLAY生成的2K分辨率PBR材质在漫反射、粗糙度和金属度通道上均保持高保真度,支持真实的基于物理的渲染。
  • 模型在多种3D控制方式(包括文本、图像及多种3D原始体素格式)上表现出强大的泛化能力,支持灵活且直观的设计工作流。
  • CLAY的训练流程通过GPT-4V实现自动标注,并结合标准化重网格化处理,确保了在超大规模3D数据集上的数据一致性与可扩展性。
  • 尽管在单个物体生成上表现优异,但由于训练数据不足及文本输入描述细节有限,CLAY在生成复杂组合场景(如“一只老虎骑着摩托车”)方面仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。