Skip to main content
QUICK REVIEW

[论文解读] Sin3DM: Learning a Diffusion Model from a Single 3D Textured Shape

Rundi Wu, Ruoshi Liu|arXiv (Cornell University)|May 24, 2023
3D Shape Modeling and Analysis被引用 6
一句话总结

Sin3DM 首次在单个3D纹理形状上训练了扩散模型,利用三平面特征图将几何与纹理压缩至低维潜在空间。通过在这些三平面特征图上使用小感受野的U-Net去噪器(结合三平面感知卷积),模型能够生成高质量、多样化的3D变体,保留精细细节,同时支持无需微调的可控编辑操作,如外补绘(outpainting)和补丁复制。

ABSTRACT

Synthesizing novel 3D models that resemble the input example has long been pursued by graphics artists and machine learning researchers. In this paper, we present Sin3DM, a diffusion model that learns the internal patch distribution from a single 3D textured shape and generates high-quality variations with fine geometry and texture details. Training a diffusion model directly in 3D would induce large memory and computational cost. Therefore, we first compress the input into a lower-dimensional latent space and then train a diffusion model on it. Specifically, we encode the input 3D textured shape into triplane feature maps that represent the signed distance and texture fields of the input. The denoising network of our diffusion model has a limited receptive field to avoid overfitting, and uses triplane-aware 2D convolution blocks to improve the result quality. Aside from randomly generating new samples, our model also facilitates applications such as retargeting, outpainting and local editing. Through extensive qualitative and quantitative evaluation, we show that our method outperforms prior methods in generation quality of 3D shapes.

研究动机与目标

  • 解决仅有一个示例时生成多样化、高质量3D纹理形状的挑战。
  • 克服直接在3D网格上训练扩散模型所导致的高内存与计算成本。
  • 实现在无需微调的情况下支持可控生成任务(如外补绘、重定向和局部编辑)。
  • 从单个形状中学习局部补丁级特征,以在生成变体中保持结构与纹理保真度。
  • 将框架扩展以支持PBR材质,实现在现代图形渲染管线中生成逼真渲染的3D资产。

提出的方法

  • 使用可学习的自编码器将单个3D纹理形状压缩为表示有符号距离场和纹理场的三平面特征图。
  • 在三平面潜在空间上训练基于2D U-Net的扩散模型,感受野受限(约特征图大小的40%),以避免过拟合。
  • 引入三平面感知的2D卷积模块,以建模三个轴对齐特征图之间的跨平面关系。
  • 在扩散过程中采用噪声预测(ε-预测)以稳定训练,针对固定干净输入的单一样本进行优化。
  • 通过空间掩码实现在推理时的控制:在去噪过程中,将掩码区域替换为指定内容(如填充输入或复制的补丁)。
  • 通过增加专用的MLP头,将解码器扩展以预测PBR材质(基础颜色、金属度、粗糙度、法线)。

实验结果

研究问题

  • RQ1能否在不依赖大规模数据集的前提下,有效训练仅基于单个3D纹理形状的扩散模型?
  • RQ2如何降低3D扩散模型训练过程中的内存与计算成本?
  • RQ3哪些架构选择(如感受野大小、三平面感知卷积)能提升从单一样本生成的高质量与泛化能力?
  • RQ4模型能否在不微调的情况下支持外补绘和局部编辑等可控生成任务?
  • RQ5模型在PBR材质上的泛化能力如何?能否生成逼真且可渲染的3D资产?

主要发现

  • Sin3DM 生成的3D形状在几何与纹理保真度方面表现优异,其在定性与定量评估中均优于先前的单形状生成方法。
  • 与基线方法相比,该模型在FID与LPIPS指标上表现更优,包括未使用三平面感知卷积或采用不同训练目标的变体。
  • 通过掩码控制的生成实现了成功的外补绘与补丁复制,过渡自然且结构保持一致。
  • 该方法支持PBR材质,可生成与Blender和Unreal Engine兼容的物理基础渲染资产。
  • 消融实验表明,三平面感知卷积与ε-预测显著提升了生成质量;若移除编码器或更改损失函数,则性能明显下降。
  • 尽管表现优异,该模型仍表现出沿三个主轴方向生成变体的倾向,这是由于三平面表示的固有特性所致,提示未来工作需采用更具表现力的3D潜在表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。