Skip to main content
QUICK REVIEW

[论文解读] ShapeGPT: 3D Shape Generation with A Unified Multi-modal Language Model

Fukun Yin, Xin Chen|arXiv (Cornell University)|Nov 29, 2023
3D Shape Modeling and Analysis被引用 4
一句话总结

ShapeGPT 提出了一种统一的多模态语言模型,通过从 VQ-VAE 提取的形状标记,将 3D 形状、文本和图像整合到单一的序列到序列框架中。通过采用三阶段训练方案的指令式生成,ShapeGPT 在文本到形状、形状编辑和形状补全等多种任务上实现了最先进性能,展示了在单一架构中强大的泛化能力和多模态对齐能力。

ABSTRACT

The advent of large language models, enabling flexibility through instruction-driven approaches, has revolutionized many traditional generative tasks, but large models for 3D data, particularly in comprehensively handling 3D shapes with other modalities, are still under-explored. By achieving instruction-based shape generations, versatile multimodal generative shape models can significantly benefit various fields like 3D virtual construction and network-aided design. In this work, we present ShapeGPT, a shape-included multi-modal framework to leverage strong pre-trained language models to address multiple shape-relevant tasks. Specifically, ShapeGPT employs a word-sentence-paragraph framework to discretize continuous shapes into shape words, further assembles these words for shape sentences, as well as integrates shape with instructional text for multi-modal paragraphs. To learn this shape-language model, we use a three-stage training scheme, including shape representation, multimodal alignment, and instruction-based generation, to align shape-language codebooks and learn the intricate correlations among these modalities. Extensive experiments demonstrate that ShapeGPT achieves comparable performance across shape-relevant tasks, including text-to-shape, shape-to-text, shape completion, and shape editing.

研究动机与目标

  • 解决缺乏统一、指令驱动的 3D 形状生成模型的问题,这些模型可整合文本、图像和 3D 形状等多种模态。
  • 克服现有任务专用模型的局限性,这些模型将形状生成、图像字幕和编辑视为孤立问题。
  • 开发一个整体性框架,能够在一个统一架构下处理多种形状相关任务,如文本到形状、形状编辑和补全。
  • 通过使用特定于形状的 VQ-VAE 将 3D 形状映射到语言兼容的标记空间,实现灵活的、指令引导的生成。
  • 建立一个多模态预训练与微调流程,使形状、图像和文本表征在单一语言模型内对齐。

提出的方法

  • 使用一种面向形状的向量量化变分自编码器(VQ-VAE)将 3D 形状离散化为固定长度的形状标记,从而实现其与语言模型标记空间的集成。
  • 使用视觉 Transformer 和视觉-语言感知器表示图像,以将视觉特征对齐至语言模型的潜在空间。
  • 通过将形状标记、文本描述和图像嵌入组合成统一序列,构建多模态段落,实现端到端的序列到序列建模。
  • 实施三阶段训练方案:(1) 仅使用形状数据进行预训练,以掌握基本的形状生成与字幕能力;(2) 在图像-形状-文本三元组上进行多模态微调,以对齐不同模态;(3) 通过指令式生成学习特定任务行为。
  • 使用 T5-base 作为核心语言模型,处理多模态序列,并在所有任务中以统一格式生成输出。
  • 应用对比损失(使用 CLIP)对齐生成的字幕与真实标注,并在形状补全与编辑任务中使用重建指标(IoU、CD、F-score)进行评估。

实验结果

研究问题

  • RQ1统一的多模态语言模型是否能有效通过单一架构处理多样化的 3D 形状生成任务,包括文本到形状、形状到文本、形状编辑和形状补全?
  • RQ2通过 VQ-VAE 集成形状标记,如何影响模型在语言模型框架中学习与生成连贯 3D 形状的能力?
  • RQ3与任务专用微调相比,指令式训练在多任务泛化方面有多大提升?
  • RQ4在形状-语言对齐方面的预训练,对模型生成语义和几何上合理形状的能力有何影响?
  • RQ5序列长度、模型大小和预训练对多模态 3D 生成任务性能的影响如何?

主要发现

  • ShapeGPT 在文本到形状、形状到文本、形状补全和形状编辑任务上均达到最先进性能,在 512 个标记设置下,IoU 达到 0.570,CD 为 1.297,F-score 为 0.396。
  • 消融实验表明,512 个形状标记(8×8×8 网格)的性能优于更短的序列(64 个标记,4×4×4 网格),表明更高分辨率可提升几何保真度。
  • 使用 T5-base 模型(2.2 亿参数)优于 T5-small(6000 万参数),证明在相同训练设置下,更大的模型容量可提升生成质量。
  • 预训练显著提升模型性能,未进行预训练的模型无法生成连贯形状或对齐模态,凸显其在学习形状-语言语法中的必要性。
  • 统一的序列到序列框架实现了无需架构更改的无缝任务迁移,表明 ShapeGPT 可在单一推理流程中处理多样化任务。
  • 定量结果表明,ShapeGPT 在所有评估指标上均优于非预训练模型和基线方法,证实了三阶段训练方案的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。