Skip to main content
QUICK REVIEW

[论文解读] Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Models for 3D Generation

Haochen Wang, Xiaodan Du|arXiv (Cornell University)|Dec 1, 2022
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本文提出Score Jacobian Chaining(SJC)方法,通过将预训练2D扩散模型的得分反向传播至可微分体素辐射场渲染器,实现3D辐射场的生成。该方法引入Perturb-and-Average Scoring以解决在对非噪声渲染图像应用去噪器时的分布偏移问题,从而在无需3D数据或微调的情况下实现高质量的文本到3D生成。

ABSTRACT

A diffusion model learns to predict a vector field of gradients. We propose to apply chain rule on the learned gradients, and back-propagate the score of a diffusion model through the Jacobian of a differentiable renderer, which we instantiate to be a voxel radiance field. This setup aggregates 2D scores at multiple camera viewpoints into a 3D score, and repurposes a pretrained 2D model for 3D data generation. We identify a technical challenge of distribution mismatch that arises in this application, and propose a novel estimation mechanism to resolve it. We run our algorithm on several off-the-shelf diffusion image generative models, including the recently released Stable Diffusion trained on the large-scale LAION dataset.

研究动机与目标

  • 仅使用预训练的2D扩散模型,无需访问3D数据或微调,实现3D生成。
  • 解决在优化过程中,将针对噪声图像训练的去噪器应用于非噪声渲染的3D图像时出现的分布外(OOD)问题。
  • 开发一种方法,将来自多个视角的2D图像梯度聚合为3D得分,用于3D资产优化。
  • 通过一种新颖的空置正则化损失函数及自适应调度策略,提升3D生成质量。
  • 研究在扩散模型3D优化背景下,噪声调度与类别条件引导的影响。

提出的方法

  • 将2D扩散模型解释为学习到的得分函数(对数密度的梯度),并通过可微分渲染器的雅可比矩阵应用链式法则。
  • 采用基于体素的辐射场作为3D参数化θ,以体积累积渲染作为可微函数f(θ),从3D参数生成2D图像xπ。
  • 提出Perturb-and-Average Scoring(PAAS)方法,通过平均多个扰动版本的得分来估计非噪声渲染图像的得分,缓解分布外问题。
  • 应用链式法则:∇θ log pσ(θ) = Jπ^T · ∇x log pσ(xπ),其中Jπ为渲染器的雅可比矩阵,∇x为扩散模型的得分。
  • 引入空置损失,惩罚3D体积分中的空洞或稀疏区域,并采用动态权重调度以改善几何结构并减少伪影。
  • 利用链式得分作为引导信号优化3D辐射场,通过潜在空间扩散推理提升效率。

实验结果

研究问题

  • RQ1能否在无3D数据或微调的情况下,有效重用预训练的2D扩散模型进行3D生成?
  • RQ2在优化过程中,当将针对噪声图像训练的去噪器应用于非噪声渲染的3D图像时,如何解决分布偏移问题?
  • RQ3在文本条件设置下,何种噪声调度策略(如退火式与随机σ)能产生更优的3D生成质量?
  • RQ4语言引导的缩放系数如何影响基于优化的3D生成流水线的性能?
  • RQ5正则化,特别是空置损失,在改善3D几何结构和减少伪影方面发挥何种作用?

主要发现

  • Perturb-and-Average Scoring有效缓解了分布外问题,使使用在噪声图像上训练的去噪器稳定优化3D资产成为可能。
  • 采用高语言引导(缩放系数10.0)的随机σ调度优于退火式σ调度,在3D生成中产生更清晰、更一致的3D模型。
  • 所提出的具有自适应调度的空置损失显著改善了3D几何结构,减少了漂浮伪影,并生成了更清晰的深度图,优于恒定或无损失的情况。
  • SJC在多样化文本提示下均能生成高质量3D资产,包括悉尼歌剧院等复杂物体及细节丰富的家具,展现出强大的泛化能力。
  • 定性对比显示,SJC在图像质量和3D模型结构完整性方面优于Stable-DreamFusion(同期方法,使用相同基础模型)。
  • 尽管性能表现强劲,该方法在不同试验中仍存在质量波动,且PAAS作为梯度信号的最优应用方式仍是开放问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。