[论文解读] Sketch-A-Shape: Zero-Shot Sketch-to-3D Shape Generation
Sketch-A-Shape 提出了一种零样本草图到3D形状生成方法,该方法利用冻结的预训练视觉模型(如CLIP、DINOv2)从训练期间的合成3D渲染图像中提取鲁棒的语义特征,从而在推理阶段无需任何成对的草图-3D数据即可从草图生成多样化的3D形状。该方法在不同草图抽象层级和3D表示形式(体素、隐式表示、CAD)上均表现出强大的泛化能力,在零样本基准测试中达到最先进性能。
Significant progress has recently been made in creative applications of large pre-trained models for downstream tasks in 3D vision, such as text-to-shape generation. This motivates our investigation of how these pre-trained models can be used effectively to generate 3D shapes from sketches, which has largely remained an open challenge due to the limited sketch-shape paired datasets and the varying level of abstraction in the sketches. We discover that conditioning a 3D generative model on the features (obtained from a frozen large pre-trained vision model) of synthetic renderings during training enables us to effectively generate 3D shapes from sketches at inference time. This suggests that the large pre-trained vision model features carry semantic signals that are resilient to domain shifts, i.e., allowing us to use only RGB renderings, but generalizing to sketches at inference time. We conduct a comprehensive set of experiments investigating different design factors and demonstrate the effectiveness of our straightforward approach for generation of multiple 3D shapes per each input sketch regardless of their level of abstraction without requiring any paired datasets during training.
研究动机与目标
- 为解决现有草图到3D生成方法因缺乏大规模成对草图-3D数据集而泛化能力受限的问题。
- 实现在训练过程中无需任何草图-3D成对数据的零样本3D形状生成。
- 探究预训练视觉模型的特征是否能跨域迁移,从渲染图像泛化到草图。
- 开发一种可泛化于多种草图类型(从随意涂鸦到专业设计)及多种3D表示形式的方法。
- 评估架构选择的影响,如特征层选择、条件机制及数据增强策略对性能的影响。
提出的方法
- 训练一个VQ-VAE以从3D形状中学习离散的形状嵌入,实现对3D几何结构的紧凑表示。
- 使用掩码Transformer模型,其条件输入为在训练期间对合成3D渲染图像应用冻结的预训练视觉模型(如CLIP、DINOv2)所提取的局部语义特征。
- 在推理阶段,相同的掩码Transformer模型通过使用相同的冻结视觉编码器从输入草图中提取特征进行条件控制,从而实现零样本生成。
- 采用视觉Transformer中间层(如L-14模型的第24层)的局部特征作为条件信号,以捕捉丰富的语义与空间信息。
- 采用包含两层MLP和可学习位置嵌入的交叉注意力机制的可学习映射网络,实现图像特征与Transformer潜在空间的一致对齐。
- 在训练过程中应用数据增强策略,如仿射变换、颜色抖动以及Canny边缘检测,以提升模型的鲁棒性与泛化能力。

实验结果
研究问题
- RQ1预训练视觉模型的特征是否能在零样本设置下,从合成3D渲染图像泛化到真实草图?
- RQ2视觉模型层的选择如何影响草图到3D生成的质量与准确性?
- RQ3最优的条件机制(如交叉注意力与自注意力对比)及映射网络架构为何种形式?
- RQ4不同数据增强策略如何影响模型在多样化草图数据集上的泛化能力?
- RQ5该方法是否能在无成对训练数据的前提下,跨多种3D表示形式(体素、隐式表示、CAD)生成多样化且高质量的3D形状?
主要发现
- 当使用L-14视觉Transformer最深层(第24层)的特征作为条件输入时,模型在QD-Acc上达到55.45%,TU-Acc为77.15%,SS-Acc为74.53%,IS-Acc为69.06%。
- 性能随深层特征的使用显著提升,第24层表现最佳,表明深层特征包含更鲁棒的语义与空间信息。
- 采用包含两层MLP、交叉注意力机制及可学习位置嵌入的映射网络时性能最优,达到57.52% QD-Acc、79.41% TU-Acc、78.18% SS-Acc与70.53% IS-Acc。
- 加入数据增强,特别是仿射变换与Canny边缘检测,显著提升整体性能,完整增强策略下达到58.96% QD-Acc、81.48% TU-Acc、79.71% SS-Acc与74.20% IS-Acc。
- 该方法在不同草图抽象层级间泛化良好,能从随意涂鸦到精细专业草图生成一致的3D形状。
- 模型在不同3D表示形式(体素、隐式表示、CAD)上均保持强大性能,展现出广泛适用性,且无需重新训练。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。