Skip to main content
QUICK REVIEW

[论文解读] Bilateral Denoising Diffusion Models

Max W. Y. Lam, Jun Wang|arXiv (Cornell University)|Aug 26, 2021
Generative Adversarial Networks and Image Synthesis参考文献 35被引用 11
一句话总结

本文提出双边去噪扩散模型(BDDMs),通过联合学习得分网络与调度网络,在采样过程中优化噪声调度,实现仅需3步即可生成高保真图像。BDDMs通过推导对数似然的更紧下界并端到端训练两个网络,实现了与标准DDPM相比62倍的加速,显著提升了采样效率,同时保持了生成质量。

ABSTRACT

Denoising diffusion probabilistic models (DDPMs) have emerged as competitive generative models yet brought challenges to efficient sampling. In this paper, we propose novel bilateral denoising diffusion models (BDDMs), which take significantly fewer steps to generate high-quality samples. From a bilateral modeling objective, BDDMs parameterize the forward and reverse processes with a score network and a scheduling network, respectively. We show that a new lower bound tighter than the standard evidence lower bound can be derived as a surrogate objective for training the two networks. In particular, BDDMs are efficient, simple-to-train, and capable of further improving any pre-trained DDPM by optimizing the inference noise schedules. Our experiments demonstrated that BDDMs can generate high-fidelity samples with as few as 3 sampling steps and produce comparable or even higher quality samples than DDPMs using 1000 steps with only 16 sampling steps (a 62x speedup).

研究动机与目标

  • 为解决去噪扩散模型的高计算成本问题,这类模型通常需要数千步采样才能生成高质量输出。
  • 通过端到端学习噪声调度而非依赖固定或手工设计的调度,提升采样效率。
  • 推导出比标准ELBO更紧的对数边际似然下界,从而实现对得分网络与调度网络的更好训练。
  • 设计一种简单高效的训练流程,可应用于任意预训练的DDPM,以优化推理调度。
  • 证明所学习的噪声调度在质量与稳定性方面显著优于固定或网格搜索的调度。

提出的方法

  • BDDMs使用调度网络σφ参数化前向过程,学习随时间变化的噪声方差βt,替代固定调度。
  • 反向过程由得分网络εθ建模,其在每一步预测噪声,与标准DDPM一致。
  • 推导出一个更紧的对数边际似然下界,该下界依赖于θ与φ,支持每步的高效优化。
  • 在合理条件下,εθ的训练目标可简化为标准DDPM损失,确保与现有训练方法的兼容性。
  • σφ的训练目标被推导为一种函数,当θ被优化时可收紧下界,从而实现得分与调度网络的联合学习。
  • 该方法允许通过仅优化调度网络,对预训练的DDPM进行高效微调,附加训练成本极低。

实验结果

研究问题

  • RQ1在训练过程中学习噪声调度是否能显著减少实现高保真生成所需的采样步数?
  • RQ2当联合优化得分与调度网络时,对数似然的更紧下界是否能带来更好的生成性能?
  • RQ3在采样速度与质量方面,BDDMs与标准DDPM、DDIM以及基于NE的方法相比表现如何?
  • RQ4调度网络是否能在不依赖步长索引先验知识的情况下,学习到有效且非均匀的噪声调度?
  • RQ5所提出方法在不同采样步数下是否具备可扩展性与稳定性,特别是在低步数情况下?

主要发现

  • BDDMs仅需3次推理步骤即可生成高保真图像,其质量与使用1000步的标准化DDPM相当。
  • 在16步采样下,BDDMs生成的样本质量与DDPM使用1000步时相当或更优,实现62倍加速。
  • BDDMs在8、16和21步下的性能保持稳定,而基于NE的方法在超过8步后性能显著下降。
  • BDDM-21中学习到的噪声调度在噪声尺度超过0.01后表现出明显的转折点,表明自适应调度可提升性能。
  • 直接将βt作为参数学习(不使用调度网络)会导致性能下降,且由于内存限制,在大步数下不可行。
  • 使用负ELBO作为调度网络的损失函数会导致退化,网络预测出恒定的全1调度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。