[论文解读] Blurring Diffusion Models
本文提出模糊扩散模型(Blurring Diffusion Models),一种新型生成模型,通过结合各向同性高斯噪声与确定性模糊(热扩散)来提升生成样本质量。通过证明模糊等价于非各向同性高斯扩散,该方法可利用标准去噪扩散技术实现高效训练,在CIFAR10上实现3.17的SOTA FID分数,在LSUN Churches上实现3.88的SOTA FID分数。
Recently, Rissanen et al., (2022) have presented a new type of diffusion process for generative modeling based on heat dissipation, or blurring, as an alternative to isotropic Gaussian diffusion. Here, we show that blurring can equivalently be defined through a Gaussian diffusion process with non-isotropic noise. In making this connection, we bridge the gap between inverse heat dissipation and denoising diffusion, and we shed light on the inductive bias that results from this modeling choice. Finally, we propose a generalized class of diffusion models that offers the best of both standard Gaussian denoising diffusion and inverse heat dissipation, which we call Blurring Diffusion Models.
研究动机与目标
- 弥合标准去噪扩散模型与反向热扩散(模糊)模型在生成样本质量方面的差距。
- 将模糊形式化为等价的非各向同性高斯扩散过程,从而可应用成熟的去噪扩散技术。
- 构建一个广义的扩散模型类别,统一各向同性噪声与确定性模糊的优势。
- 通过实验评估模糊强度与噪声调度对模型收敛性与样本质量的影响。
提出的方法
- 该模型定义了一种结合确定性模糊与加性各向同性高斯噪声的扩散过程,将整体过程建模为非各向同性高斯扩散。
- 建立了模糊与具有非各向同性噪声的高斯扩散之间的等价关系,支持马尔可夫转移及频域中的对角协方差结构。
- 采用可学习的epsilon参数化形式化去噪过程,从而可利用标准去噪扩散目标实现高效训练。
- 采用可学习的噪声调度控制模糊强度,参数化为 $\sigma_{B,t} = \sigma_{B,\max} \sin^2(t\pi/2)$ 或 $\sin(t\pi/2)$,以调节时间上的模糊速率。
- 利用频域中的对角协方差结构,实现高效推理与训练,类似于标准去噪扩散模型。
实验结果
研究问题
- RQ1能否通过非各向同性高斯过程,正式建立模糊(热扩散)与标准去噪扩散之间的联系?
- RQ2将模糊与各向同性噪声结合,是否能超越标准去噪扩散或纯反向热扩散模型的样本质量?
- RQ3不同的模糊强度与噪声调度如何影响训练动力学与最终样本质量?
- RQ4模糊引入的归纳偏置是什么?其在泛化能力与感知质量方面与各向同性噪声相比如何?
主要发现
- 模糊扩散模型在CIFAR10上实现3.17的FID分数,优于标准去噪扩散(3.58)与反向热扩散模型(18.96)。
- 在LSUN Churches(128×128)上,模型实现3.88的FID分数,优于标准去噪扩散(4.68)与IHDM(45.1)。
- 最大模糊强度更高的模型($\sigma_{B,\max} = 20$)收敛更慢,但样本质量更优,表明其具有正则化效应。
- 与$\sin$调度相比,$\sin^2$调度表现更优,尤其在高模糊水平下,因其在早期时间步更平缓地施加模糊。
- 在CIFAR10上,$\sigma_{B,\max} = 20$的模型仅在训练20万步后才超越基线,表明其达到最优性能需要更长训练周期。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。