[论文解读] HoloDiffusion: Training a 3D Diffusion Model using 2D Images
HoloDiffusion 首次提出一种仅在姿态对齐的 2D 图像上进行训练的 3D 感知生成扩散模型,采用混合显式-隐式特征网格与可微渲染损失,实现无需 3D 监督的端到端训练。该方法在 CO3Dv2 数据集上实现了最先进的 3D 视角一致性与生成质量,在 FID 和 KID 指标上优于现有方法,同时保持可扩展、内存解耦的推理能力。
Diffusion models have emerged as the best approach for generative modeling of 2D images. Part of their success is due to the possibility of training them on millions if not billions of images with a stable learning objective. However, extending these models to 3D remains difficult for two reasons. First, finding a large quantity of 3D training data is much more complex than for 2D images. Second, while it is conceptually trivial to extend the models to operate on 3D rather than 2D grids, the associated cubic growth in memory and compute complexity makes this infeasible. We address the first challenge by introducing a new diffusion setup that can be trained, end-to-end, with only posed 2D images for supervision; and the second challenge by proposing an image formation model that decouples model memory from spatial memory. We evaluate our method on real-world data, using the CO3D dataset which has not been used to train 3D generative models before. We show that our diffusion models are scalable, train robustly, and are competitive in terms of sample quality and fidelity to existing approaches for 3D generative modeling.
研究动机与目标
- 通过仅使用姿态对齐的 2D 图像进行训练,实现 3D 扩散模型的训练,避免对大规模 3D 数据集的依赖。
- 通过将特征网格分辨率与渲染分辨率解耦,缓解 3D 扩散模型的立方体内存与计算复杂度问题。
- 通过可学习的、可微的渲染模块,确保在不同视角下生成的一致性。
- 尽管仅使用 2D 监督进行训练,仍实现与现有 3D 生成模型相当的样本质量与保真度。
- 在真实世界、类别特定的 3D 数据上展示可扩展性与鲁棒性,数据来源为 CO3Dv2 数据集。
提出的方法
- 该方法使用混合显式-隐式特征网格,存储 3D 特征并支持任意视角的可微渲染。
- 通过预训练的图像编码器从输入的 2D 图像中提取特征,进而用于条件化 3D 特征网格。
- 向 3D 特征网格中添加噪声,并训练 3D U-Net 去噪器通过渲染图像与真实训练图像之间的光度损失,逆转该过程。
- 训练目标定义为:从去噪网格渲染出的图像与对应真实图像之间的 L2 损失,从而实现端到端优化。
- 特征网格分辨率与渲染分辨率解耦,降低内存复杂度,实现在不增加模型大小的前提下高保真渲染。
- 系统仅使用姿态对齐图像的监督进行端到端训练,训练过程中不访问任何 3D 真值数据。
实验结果
研究问题
- RQ1能否仅使用姿态对齐的 2D 图像有效训练 3D 扩散模型,而无需 3D 监督?
- RQ2如何在仅基于 2D 图像数据训练的扩散模型中强制实现 3D 视角一致性?
- RQ3能否设计一种内存高效的 3D 表示方法,实现特征网格分辨率与渲染分辨率的解耦?
- RQ4与现有 3D 生成模型相比,2D 监督下的 3D 扩散模型在样本质量与保真度方面表现如何?
- RQ5该模型能否在跨类别场景下泛化,并从少视角输入生成多样且高质量的 3D 一致样本?
主要发现
- HoloDiffusion 在 CO3Dv2 数据集上实现了 SOTA 的 FID 与 KID 分数,平均 FID 为 104.9,平均 KID 为 0.091,优于 EG3D 与 GET3D。
- 在泰迪熊类别中,HoloDiffusion 的 FID 为 109.2,KID 为 0.106,显著优于 pi-GAN 的 125.8 FID 与 0.118 KID。
- 该方法生成的样本具有高度视角一致性,定性对比显示其在不同视角下外观保持一致,而 pi-GAN 缺乏 3D 一致性。
- HoloDiffusion 在少样本设置下泛化良好,即使在有限监督下仍能保持稳定训练。
- 模型的 3D 感知生成能力在迭代采样过程中清晰可见:渲染视图从噪声逐步演化为一致的 3D 结构。
- 消融研究证实,HoloDiffusion 的自举版本可提升性能,表明自监督微调具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。