Skip to main content
QUICK REVIEW

[论文解读] Exploring Continual Learning of Diffusion Models

Michał Zając, Kamil Rafał Deja|arXiv (Cornell University)|Mar 27, 2023
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

该论文首次研究了扩散模型中的持续学习(CL),表明通过降低重放系数的经验重放能有效缓解灾难性遗忘。研究发现,标准的每维比特数(BPD)指标无法准确反映遗忘情况,而时间步依赖的过拟合——尤其在去噪的早期步骤中——会严重损害性能,因此在扩散模型的持续学习中需要仔细调整超参数。

ABSTRACT

Diffusion models have achieved remarkable success in generating high-quality images thanks to their novel training procedures applied to unprecedented amounts of data. However, training a diffusion model from scratch is computationally expensive. This highlights the need to investigate the possibility of training these models iteratively, reusing computation while the data distribution changes. In this study, we take the first step in this direction and evaluate the continual learning (CL) properties of diffusion models. We begin by benchmarking the most common CL methods applied to Denoising Diffusion Probabilistic Models (DDPMs), where we note the strong performance of the experience replay with the reduced rehearsal coefficient. Furthermore, we provide insights into the dynamics of forgetting, which exhibit diverse behavior across diffusion timesteps. We also uncover certain pitfalls of using the bits-per-dimension metric for evaluating CL.

研究动机与目标

  • 研究在训练成本高昂的扩散模型中实现持续学习的可行性与挑战。
  • 在去噪扩散概率模型(DDPMs)上基准化现有持续学习方法,特别是经验重放方法。
  • 分析不同扩散时间步上的遗忘动态,并识别标准评估指标(如每维比特数BPD)的局限性。
  • 揭示经验重放中的结构性问题,如时间步依赖的过拟合,并提出缓解策略。
  • 为未来在扩散模型中开展持续学习研究(尤其是文本到图像及预训练架构)奠定基础。

提出的方法

  • 在MNIST和Fashion-MNIST数据集上,使用DDPM对常见持续学习方法(包括微调和经验重放)进行基准测试。
  • 通过调整重放系数,控制训练过程中存储缓冲区样本的影响。
  • 采用简化的DDPM训练损失(公式3),该损失最小化每个时间步上预测噪声与真实噪声之间的均方误差。
  • 使用随机采样数据、噪声和时间步的随机梯度下降进行训练,以优化对数似然的变分下界。
  • 通过测量持续训练后对先前任务的性能下降,并可视化随时间推移的样本质量,分析遗忘动态。
  • 通过在早期(如t=50)和晚期(如t=700)时间步评估损失和生成质量,研究扩散时间步对过拟合的影响。

实验结果

研究问题

  • RQ1经验重放能否在扩散模型的持续学习中有效防止灾难性遗忘?
  • RQ2遗忘在不同扩散时间步上如何表现,其严重程度是否有所不同?
  • RQ3为何每维比特数(BPD)指标无法反映持续学习中实际的生成性能退化?
  • RQ4扩散模型中经验重放的时间步依赖过拟合的成因是什么,如何缓解?
  • RQ5DDPM的结构性质(如去噪和生成阶段)如何影响持续学习动态?

主要发现

  • 使用较低重放系数(如0.01)的经验重放显著优于标准微调,能有效防止DDPM中的灾难性遗忘。
  • 尽管生成能力完全丧失,BPD指标仍表现出极小的退化,表明其作为评估扩散模型持续学习性能的代理指标并不可靠。
  • 对重放缓冲区的过拟合主要发生在早期扩散时间步(如t=50),此时缓冲区数据的损失急剧下降;而晚期时间步(如t=700)由于噪声水平较高,未出现过拟合。
  • 早期时间步对对数似然和模型质量贡献最大,因此最易受到遗忘影响,这解释了为何BPD指标保持稳定,即使样本质量已严重退化。
  • 时间步依赖的过拟合由早期时间步损失分量的较大尺度以及晚期时间步缺乏噪声正则化所驱动,后者可防止过拟合。
  • 降低重放系数能有效缓解过拟合并提升整体生成性能,凸显了在扩散模型的持续学习中进行超参数调优的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。