Skip to main content
QUICK REVIEW

[论文解读] Refining Generative Process with Discriminator Guidance in Score-based Diffusion Models

Dongjun Kim, Yeongmin Kim|arXiv (Cornell University)|Nov 28, 2022
Generative Adversarial Networks and Image Synthesis被引用 13
一句话总结

本文提出判别器引导(Discriminator Guidance),通过在去噪得分路径中引入判别器监督的修正项,对预训练的基于分数的扩散模型进行样本生成优化。在分数模型训练完成后独立训练判别器,并将其反馈作为引导项注入,该方法在 ImageNet 256x256 上实现了 SOTA 的 FID 1.83 和召回率 0.64,与真实数据统计特性高度接近(FID 1.68,召回率 0.66)。

ABSTRACT

The proposed method, Discriminator Guidance, aims to improve sample generation of pre-trained diffusion models. The approach introduces a discriminator that gives explicit supervision to a denoising sample path whether it is realistic or not. Unlike GANs, our approach does not require joint training of score and discriminator networks. Instead, we train the discriminator after score training, making discriminator training stable and fast to converge. In sample generation, we add an auxiliary term to the pre-trained score to deceive the discriminator. This term corrects the model score to the data score at the optimal discriminator, which implies that the discriminator helps better score estimation in a complementary way. Using our algorithm, we achive state-of-the-art results on ImageNet 256x256 with FID 1.83 and recall 0.64, similar to the validation data's FID (1.68) and recall (0.66). We release the code at https://github.com/alsdudrla10/DG.

研究动机与目标

  • 解决预训练扩散模型在不微调得分模型的前提下生成高保真、多样化样本的局限性。
  • 通过在生成过程中引入互补监督,克服分类器引导采样中的模式崩溃和质量退化问题。
  • 实现在得分模型预训练后稳定且快速的判别器训练,避免 GAN 中常见的联合优化不稳定与复杂性问题。
  • 通过轻量级、后训练的优化机制,同时提升样本质量(FID)与类内多样性(召回率)。
  • 为现有扩散模型提供即插即用的解决方案,在不重新训练得分模型的前提下增强生成图像的真实感。

提出的方法

  • 在得分模型预训练完成后,独立训练一个判别器,用于在所有噪声尺度下区分真实样本与生成样本。
  • 基于判别器的输出,对预训练的得分函数引入一个修正项,引导去噪路径向更逼真的区域移动。
  • 该修正项近似于在最优判别器下,模型得分与真实数据得分之间的差距,其推导基于定理 1。
  • 通过引导去噪过程在采样阶段应用修改后的得分函数,有效调整得分函数以提升生成图像的真实感。
  • 采用连续时间 SDE 框架提供理论支持,尽管该方法适用于离散与连续两种设置。
  • 利用判别器的梯度引导得分修正,确保生成样本与真实样本难以区分。

实验结果

研究问题

  • RQ1预训练的基于分数的扩散模型是否能在不重新训练得分网络的前提下,生成更高保真度和更丰富的多样化样本?
  • RQ2判别器是否能在采样过程中提供稳定、有效且互补的监督,从而提升生成图像的真实感与多样性?
  • RQ3在得分模型训练后独立训练判别器,是否能避免联合 GAN 训练中的不稳定性与复杂性,同时仍能提升生成质量?
  • RQ4判别器的反馈是否可被数学形式化,以修正得分函数,使其与真实数据得分对齐?
  • RQ5该方法在计算开销极低的前提下,能否在 ImageNet 256x256 等基准数据集上实现接近 SOTA 的性能?

主要发现

  • 所提出的判别器引导方法在 ImageNet 256x256 上实现了新的 SOTA FID 1.83 和召回率 0.64,与真实数据统计特性高度接近(FID 1.68,召回率 0.66)。
  • 在 CIFAR-10 上,该方法在 EDM-G++ 设置下取得 FID 1.77,在条件生成设置下取得 FID 1.64,展现出跨设置的强性能。
  • 在 CelebA/FFHQ 64x64 上,该方法在 Soft Truncation-G++ 设置下取得 FID 1.34,证明其在高保真人脸生成任务中的有效性。
  • 该方法同时提升了 FID 与召回率,避免了分类器引导采样中常见的模式崩溃问题。
  • 判别器训练收敛稳定且迅速,计算成本极低,如表 6 和图 3 所示。
  • 视觉样本(图 32–51)表明,判别器引导在多个类别与数据集上均能生成逼真、多样且高保真的图像。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。