[论文解读] Score-based Denoising Diffusion with Non-Isotropic Gaussian Noise Models
本文通过用非各向同性多变量高斯噪声(特别是高斯自由场,GFFs)替代标准各向同性高斯噪声,提出了一种基于得分的去噪扩散模型的推广,以建模具有相关性和结构化的噪声。作者推导了该新公式下的训练与采样数学基础,并通过实证结果表明,在CIFAR-10上使用GFF噪声训练的模型可生成与各向同性基线相当质量的样本,证明了非各向同性噪声在扩散建模中的可行性和潜力。
Generative models based on denoising diffusion techniques have led to an unprecedented increase in the quality and diversity of imagery that is now possible to create with neural generative models. However, most contemporary state-of-the-art methods are derived from a standard isotropic Gaussian formulation. In this work we examine the situation where non-isotropic Gaussian distributions are used. We present the key mathematical derivations for creating denoising diffusion models using an underlying non-isotropic Gaussian noise model. We also provide initial experiments with the CIFAR-10 dataset to help verify empirically that this more general modeling approach can also yield high-quality samples.
研究动机与目标
- 将基于得分的去噪扩散模型从各向同性高斯噪声推广至非各向同性多变量高斯噪声。
- 推导在非各向同性噪声(特别是高斯自由场,GFFs)下训练与采样的理论框架。
- 通过实证验证,非各向同性噪声模型可生成与各向同性基线相当的高质量生成结果。
- 实现新型扩散模型类别,利用具有结构化、相关性噪声模式的模型以改善数据建模。
提出的方法
- 使用协方差矩阵Σ而非单位矩阵,推导非各向同性多变量高斯分布的前向加噪过程。
- 通过贝叶斯法则和非各向同性噪声下的条件分布,重构反向去噪过程,相应调整均值与方差。
- 通过加权损失函数(基于得分方差的倒数)调整得分匹配目标,使其依赖于协方差结构。
- 引入校正后的得分估计网络输出,通过Σ⁻¹缩放处理非各向同性噪声,确保梯度流的正确性。
- 将该框架应用于高斯自由场(GFFs),通过频域掩码或卷积滤波对各向同性噪声进行处理,生成更平滑、具有相关性的噪声。
- 在采样过程中引入基于调和平均的校正方法,以保持非各向同性噪声下估计得分与真实得分之间的一致性。
实验结果
研究问题
- RQ1基于得分的去噪扩散模型能否成功地从各向同性高斯噪声推广到非各向同性高斯噪声分布?
- RQ2在非各向同性噪声下,前向与反向过程的正确数学公式是什么?
- RQ3使用高斯自由场(GFFs)作为非各向同性噪声源,对图像生成中的样本质量有何影响?
- RQ4得分匹配目标能否被调整以在非各向同性噪声下保持训练稳定性和性能?
- RQ5所提出的非各向同性扩散模型在CIFAR-10等标准基准上是否能达到与各向同性基线相当的样本质量?
主要发现
- 成功推导出非各向同性去噪扩散模型的理论框架,将标准DDPM与SMLD公式推广至具有任意协方差的多变量高斯噪声。
- 使用高斯自由场(GFFs)作为非各向同性噪声源,可通过频域滤波或卷积操作实现更平滑、具有相关性的噪声模式建模。
- 在CIFAR-10上的实证结果表明,所提出的非各向同性扩散模型可生成与各向同性基线相当的高质量样本,验证了该方法的有效性。
- 校正后的得分估计网络(包含Σ⁻¹缩放与调和平均校正)确保了在非各向同性噪声下准确的得分估计与稳定的采样过程。
- 经修改的得分匹配目标(在非各向同性情况下以得分方差的倒数加权)保持了训练收敛性与性能。
- 该框架具有通用性,适用于DDPM与SMLD两种变体,附录中提供了两者的推导过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。