Skip to main content
QUICK REVIEW

[论文解读] SALAD: Part-Level Latent Diffusion for 3D Shape Generation and Manipulation

Juil Koo, Seung-Woo Yoo|arXiv (Cornell University)|Mar 21, 2023
3D Shape Modeling and Analysis被引用 4
一句话总结

SALAD 提出了一种用于 3D 形状生成与操作的级联潜在扩散模型,采用部件级隐式表示,实现了最先进水平的生成质量,并可在无需微调的情况下实现零样本部件级编辑。通过解耦外部与内部部件嵌入,并在两阶段级联中应用扩散机制,该方法在形状生成、部件混合、精炼以及文本引导补全方面均表现出卓越性能。

ABSTRACT

We present a cascaded diffusion model based on a part-level implicit 3D representation. Our model achieves state-of-the-art generation quality and also enables part-level shape editing and manipulation without any additional training in conditional setup. Diffusion models have demonstrated impressive capabilities in data generation as well as zero-shot completion and editing via a guided reverse process. Recent research on 3D diffusion models has focused on improving their generation capabilities with various data representations, while the absence of structural information has limited their capability in completion and editing tasks. We thus propose our novel diffusion model using a part-level implicit representation. To effectively learn diffusion with high-dimensional embedding vectors of parts, we propose a cascaded framework, learning diffusion first on a low-dimensional subspace encoding extrinsic parameters of parts and then on the other high-dimensional subspace encoding intrinsic attributes. In the experiments, we demonstrate the outperformance of our method compared with the previous ones both in generation and part-level completion and manipulation tasks.

研究动机与目标

  • 开发一种 3D 扩散模型,实现最先进水平的生成质量,同时支持零样本部件级操作。
  • 解决现有 3D 扩散模型因潜在代码中缺乏结构与空间信息而导致的编辑与补全能力受限的问题。
  • 设计一种级联扩散框架,通过分离外部与内部组件,有效学习高维部件嵌入。
  • 通过文本条件与部件选择实现灵活的、用户驱动的形状编辑,无需重新训练。
  • 在包括部件混合、精炼与文本引导补全在内的多种操作任务中,展示模型的多功能性。

提出的方法

  • 采用部件级隐式表示,其中每个部件由一个解耦嵌入向量编码,捕捉外部(位置、方向)与内部(几何细节)参数。
  • 引入两阶段级联扩散流程:首先在低维子空间中生成外部参数,然后在给定外部参数的条件下生成内部潜在代码。
  • 采用基于 Transformer 的架构,结合时间步条件自注意力机制,确保集合表示中部件间的排列不变性与全局信息交互。
  • 在潜在空间中应用噪声调度与反向去噪,从随机噪声生成完整的 3D 形状。
  • 通过 AdaLN 将文本嵌入条件化于反向扩散过程,以实现文本引导的生成与补全。
  • 与基于文本的语义部件分割模型(GAUSSGLOT)集成,支持交互式、基于文本的部件选择与编辑。

实验结果

研究问题

  • RQ1基于部件级表示训练的 3D 扩散模型能否在实现最先进生成质量的同时,支持零样本部件级编辑?
  • RQ2将外部与内部部件嵌入分离在多大程度上提升了 3D 形状生成的质量与可控性?
  • RQ3具有解耦部件表示的潜在扩散模型在支持部件混合、精炼与文本引导补全等多样化操作任务方面的能力如何?
  • RQ4该模型能否在无需微调的情况下泛化至条件生成任务(如文本到 3D 形状合成)?
  • RQ5级联扩散设计在高维部件嵌入空间中如何提升训练稳定性和生成质量?

主要发现

  • SALAD 在 3D 形状生成方面达到最先进性能,在所有形状类别上均优于 SPAGHETTI 及其他基线方法,CD 与 EMD 指标表现更优。
  • 在部件混合与精炼任务中,SALAD 显著提升了输出质量,平均相比 SPAGHETTI 在 CD 上降低 3.21%,在 EMD 上降低 1.83%。
  • 在文本引导生成任务中,SALAD 达到 4.043 的 FPD 分数,显著优于 AutoSDF 的 31.53,表明其生成结果具有更高的保真度与真实感。
  • 在文本引导的部件补全任务中,SALAD 成功根据文本描述完成选定部件,经定性结果与神经评估偏好验证(SALAD 为 42.22 NEP,AutoSDF 为 38.98)。
  • 模型在编辑任务中展现出强大的零样本能力,所有类别在 1-NNA 指标上均有明显提升,表明局部形状一致性更优。
  • 级联扩散设计有效促进了高维潜在空间中的学习,提升了生成质量,且未增加计算成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。