[论文解读] Denoising Diffusion Gamma Models
本文提出了去噪扩散伽马分布模型(DDGM),将扩散模型中的高斯噪声替换为伽马分布噪声,以提升图像与语音生成的质量。通过利用伽马分布的闭式可加性特性,该方法实现了高效的采样,并在FID分数上达到最先进水平,同时在PESQ和STOI指标上表现更优,证明了其在样本质量与更快收敛速度方面的优越性。
Generative diffusion processes are an emerging and effective tool for image and speech generation. In the existing methods, the underlying noise distribution of the diffusion process is Gaussian noise. However, fitting distributions with more degrees of freedom could improve the performance of such generative models. In this work, we investigate other types of noise distribution for the diffusion process. Specifically, we introduce the Denoising Diffusion Gamma Model (DDGM) and show that noise from Gamma distribution provides improved results for image and speech generation. Our approach preserves the ability to efficiently sample state in the training diffusion process while using Gamma noise.
研究动机与目标
- 探究扩散模型中非高斯噪声分布的应用,以超越标准高斯假设,提升生成性能。
- 探索具有两个参数(形状与尺度)的伽马分布是否在扩散过程中提供优于单参数高斯噪声的建模能力。
- 在使用伽马噪声的同时,保持扩散模型的关键效率特性——无需迭代步骤即可采样任意状态。
- 在图像与语音生成基准上评估所提出的DDGM,与标准DDPM和DDIM模型进行对比。
- 证明伽马噪声可加速收敛,并在视觉与音频生成任务中生成更高质量的样本。
提出的方法
- 提出一种去噪扩散伽马分布模型(DDGM),在前向扩散过程中将高斯噪声替换为伽马分布噪声。
- 利用伽马分布的闭式性质:具有相同尺度参数的独立伽马随机变量之和仍为伽马分布,从而实现无需递归的多步噪声添加,提升效率。
- 推导伽马扩散模型的反向去噪过程与变分下界,确保训练的稳定性和一致性。
- 采用由形状与尺度参数参数化的噪声调度,初始尺度参数θ₀设为0.001以获得最佳性能。
- 将现有的DDPM与DDIM推理流程适配至基于伽马分布的模型,实现与高斯基线模型的直接对比。
- 采用标准训练协议(如线性β-调度,与DDPM相同的超参数),确保在CelebA与LSUN Church数据集上的公平评估。
实验结果
研究问题
- RQ1在扩散模型中用伽马噪声替代高斯噪声,是否能提升图像与语音生成任务中的生成质量?
- RQ2伽马分布的双参数灵活性是否能比单参数高斯分布更优地拟合扩散过程中的残差噪声?
- RQ3能否利用伽马分布的闭式可加性特性,在不依赖迭代步骤的情况下保持扩散过程的高效采样?
- RQ4与标准高斯基底的扩散模型相比,使用伽马噪声是否能加速收敛并提升FID、PESQ与STOI得分?
- RQ5所提出的DDGM模型在不同推理调度与数据集类型(如CelebA、LSUN Church、LJ Speech)下是否具备鲁棒性?
主要发现
- 在CelebA(64×64)数据集上,DDGM结合DDPM推理在100步时达到FID分数14.22,优于高斯DDPM(45.20),并接近在1000步时的DDPM基线(3.26)。
- 在LSUN Church(256×256)数据集上,DDGM结合DDIM推理在100步时达到FID 8.75,优于高斯DDIM基线的10.58。
- 在LJ数据集的语音生成任务中,DDGM在1000次迭代时达到PESQ分数3.308,超过WaveGrad基线(3.290),STOI达到0.969,高于基线(0.959)。
- 如图1c所示,伽马分布在拟合扩散过程中估计的残差噪声时,相比高斯分布表现出更低的MSE,证明其拟合效果更优。
- DDGM模型保持了在不计算前序步骤的情况下采样扩散链中任意状态的能力,从而保留了标准扩散模型的效率优势。
- DDGM生成的视觉样本在感知质量与细节清晰度方面优于DDPM与DDIM基线,尤其在CelebA数据集上生成面部特征时表现更佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。