[论文解读] Perception Prioritized Training of Diffusion Models
本文提出感知优先(P2)加权方法,一种简单而有效的扩散模型训练重加权方案,通过优先考虑模型学习感知丰富视觉概念的噪声水平来提升性能。通过为中间噪声水平(图像内容仍可辨识)分配更高的损失权重,该方法在多个数据集、模型架构和采样策略下显著提升了生成样本质量,在CelebA-HQ和Oxford-Flowers数据集上实现了SOTA级FID分数。
Diffusion models learn to restore noisy data, which is corrupted with different levels of noise, by optimizing the weighted sum of the corresponding loss terms, i.e., denoising score matching loss. In this paper, we show that restoring data corrupted with certain noise levels offers a proper pretext task for the model to learn rich visual concepts. We propose to prioritize such noise levels over other levels during training, by redesigning the weighting scheme of the objective function. We show that our simple redesign of the weighting scheme significantly improves the performance of diffusion models regardless of the datasets, architectures, and sampling strategies.
研究动机与目标
- 探究扩散模型在训练过程中于不同噪声水平下如何学习视觉概念。
- 解决扩散模型训练中损失加权缺乏系统性理解与优化的问题。
- 在不改变模型架构或增加额外训练步骤的前提下提升生成样本质量。
- 设计一种优先考虑感知信息丰富噪声水平而非仅产生细微、难以察觉细节的噪声水平的加权方案。
提出的方法
- 该方法基于每个噪声水平的感知重要性对去噪得分匹配损失进行重加权,为中间噪声水平(图像内容仍具有可感知性)分配更高的权重。
- P2加权方案基于对模型在各噪声水平下学习到的视觉概念的实证分析,对支持高层级、感知丰富的特征学习的噪声水平赋予更高权重。
- 加权函数设计为分段线性或平滑函数,在中间噪声水平处达到峰值,并向极低和极高噪声水平逐渐降低。
- 该方法与标准扩散训练和采样协议兼容,无需修改模型架构或推理步数。
- 通过在多个数据集(CelebA-HQ、FFHQ、Oxford-Flowers)、模型架构和采样调度方案上进行评估,验证其泛化能力。

实验结果
研究问题
- RQ1扩散过程中哪些噪声水平最有助于学习感知丰富的视觉概念?
- RQ2损失加权在不同噪声水平上的分布如何影响生成图像的质量?
- RQ3能否通过一种简单且有原则的重加权方案,在不修改模型架构或增加额外训练开销的情况下提升生成样本质量?
- RQ4所提出的加权方案是否能在不同数据集、模型架构和采样策略下实现泛化?
主要发现
- P2加权方案在CelebA-HQ数据集上实现了SOTA级FID分数8.92,优于以往方法。
- 在Oxford-Flowers数据集上,该方法实现了新的SOTA FID分数10.12,显著优于基线模型。
- 在FFHQ数据集上,该方法在250次采样步数下实现了FID 10.88,优于基线模型,且与基于GAN的模型性能相当。
- 该改进在不同采样调度下保持一致,即使仅使用60步,P2方法仍优于基线模型。
- 无论模型架构或采样策略如何,该方法均能提升性能,展现出广泛的泛化能力。
- 消融实验确认,优先考虑内容仍可感知的中间噪声水平,可带来比均匀加权或标准加权损失方案更优的生成样本质量。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。