[论文解读] Large-Vocabulary 3D Diffusion Model with Transformer
本文提出 DiffTF,一种基于三平面的 3D 扩散模型,采用 3D 感知 Transformer,用于大规模词汇量的 3D 物体生成。它通过共享的跨平面注意力机制以及 3D 感知编码器/解码器,提取通用化与专用化的 3D 特征,在 OmniObject3D 数据集上实现了 216 种多样化真实世界类别中最高水平的性能,几何与纹理保真度均极高。
Creating diverse and high-quality 3D assets with an automatic generative model is highly desirable. Despite extensive efforts on 3D generation, most existing works focus on the generation of a single category or a few categories. In this paper, we introduce a diffusion-based feed-forward framework for synthesizing massive categories of real-world 3D objects with a single generative model. Notably, there are three major challenges for this large-vocabulary 3D generation: a) the need for expressive yet efficient 3D representation; b) large diversity in geometry and texture across categories; c) complexity in the appearances of real-world objects. To this end, we propose a novel triplane-based 3D-aware Diffusion model with TransFormer, DiffTF, for handling challenges via three aspects. 1) Considering efficiency and robustness, we adopt a revised triplane representation and improve the fitting speed and accuracy. 2) To handle the drastic variations in geometry and texture, we regard the features of all 3D objects as a combination of generalized 3D knowledge and specialized 3D features. To extract generalized 3D knowledge from diverse categories, we propose a novel 3D-aware transformer with shared cross-plane attention. It learns the cross-plane relations across different planes and aggregates the generalized 3D knowledge with specialized 3D features. 3) In addition, we devise the 3D-aware encoder/decoder to enhance the generalized 3D knowledge in the encoded triplanes for handling categories with complex appearances. Extensive experiments on ShapeNet and OmniObject3D (over 200 diverse real-world categories) convincingly demonstrate that a single DiffTF model achieves state-of-the-art large-vocabulary 3D object generation performance with large diversity, rich semantics, and high quality.
研究动机与目标
- 解决在广泛真实世界类别词汇量下生成多样化、高质量 3D 物体的挑战。
- 克服先前单类别或窄词汇量 3D 生成模型的局限性。
- 开发一种高效且表达力强的 3D 表示方法,平衡保真度与计算成本。
- 整合通用 3D 知识与专用特征,以应对极端的几何与纹理多样性。
- 实现平滑、语义上合理的潜在空间插值,以支持多样化 3D 物体生成。
提出的方法
- 采用改进的三平面表示,引入归一化与总变差正则化,以提升拟合速度、准确率及收敛稳定性。
- 提出一种 3D 感知 Transformer,通过共享的跨平面注意力机制,从各平面中提取通用 3D 知识,并与类别特定特征相融合。
- 设计一种 3D 感知编码器/解码器,保留特征编码过程中的 3D 空间关系,增强语义与几何感知能力。
- 采用前馈扩散框架,在三平面特征上进行端到端训练,以生成具有高质量几何结构与照片级真实感纹理的 3D 物体。
- 对三平面特征施加强正则化与分布约束,以稳定训练过程并提升生成质量。
- 结合显式三平面特征与隐式扩散建模,构建混合 3D 表示,实现高效且高保真度的生成。
实验结果
研究问题
- RQ1单一生成模型能否在超过 200 个真实世界类别中,以高几何与纹理质量有效生成多样化 3D 物体?
- RQ2如何有效提取并组合通用 3D 知识与专用特征,以应对极端的类别级差异?
- RQ3与标准 2D 自注意力相比,三平面之间 3D 感知注意力在多大程度上提升了特征表示能力?
- RQ4三平面归一化与正则化对 3D 扩散生成的稳定性与质量有何影响?
- RQ5该模型的潜在空间是否能够支持在多样化 3D 物体之间实现平滑、语义上合理的插值?
主要发现
- DiffTF 在 OmniObject3D 上实现最先进性能,该基准包含 216 种多样化的真实世界类别,涵盖松果、火龙果等复杂物体。
- 在 OmniObject3D 上,DiffTF 的 Fréchet Inception Distance (FID) 达到 25.36,KID 为 0.8%,显著优于先前方法。
- 消融实验表明,三平面归一化与正则化使 FID 从 125.21 降低至 52.35,证明其在模型稳定性和质量中的关键作用。
- 与基线相比,采用跨平面注意力的 3D 感知 Transformer 将 FID 改进 13.78 分,凸显其在捕捉通用 3D 知识方面的有效性。
- 定性结果表明,生成物体具有丰富的语义细节、逼真的纹理以及拓扑结构正确的几何形态,即使在高度复杂的类别中亦然。
- 潜在空间插值可实现多样化物体之间的语义平滑过渡,证实模型具备学习解耦且有意义表征的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。