[论文解读] Diffusion Guided Domain Adaptation of Image Generators
本文提出了一种新颖的图像生成器领域自适应方法,通过分数蒸馏采样(SDS)利用分类器自由扩散模型作为冻结的高质量判别器,仅使用文本提示引导 GAN 向新图像领域迁移。通过从预训练扩散模型蒸馏知识,并引入扩散引导正则化与层选择策略,该方法在无需目标领域真实图像的情况下,实现了最先进的 FID 分数与 CLIP 分数,且图像质量与可控性显著提升,即使在复杂提示下也优于先前工作。
Can a text-to-image diffusion model be used as a training objective for adapting a GAN generator to another domain? In this paper, we show that the classifier-free guidance can be leveraged as a critic and enable generators to distill knowledge from large-scale text-to-image diffusion models. Generators can be efficiently shifted into new domains indicated by text prompts without access to groundtruth samples from target domains. We demonstrate the effectiveness and controllability of our method through extensive experiments. Although not trained to minimize CLIP loss, our model achieves equally high CLIP scores and significantly lower FID than prior work on short prompts, and outperforms the baseline qualitatively and quantitatively on long and complicated prompts. To our best knowledge, the proposed method is the first attempt at incorporating large-scale pre-trained diffusion models and distillation sampling for text-driven image generator domain adaptation and gives a quality previously beyond possible. Moreover, we extend our work to 3D-aware style-based generators and DreamBooth guidance.
研究动机与目标
- 实现预训练 GAN 生成器在无需目标领域真实图像情况下的零样本领域自适应。
- 通过使用扩散模型作为更具信息量的判别器,克服 CLIP 引导方法的局限性,如潜在空间错位与 CLIP 损失最小化困难等问题。
- 通过利用如 StableDiffusion 等大规模扩散模型的生成先验,提升文本驱动领域自适应中的图像质量与多样性。
- 引入新型正则化技术——扩散引导方向性与重建正则化,防止模型崩溃并保留语义细节。
- 将方法扩展至 3D 感知生成器(如 EG3D)及 DreamBooth 微调的扩散模型,以提升适用范围。
提出的方法
- 利用预训练文本到图像扩散模型(如 StableDiffusion)的分数蒸馏采样(SDS)作为可微分、图像空间的判别器,指导 GAN 生成器的优化。
- 引入一种扩散引导方向性正则化($\mathcal{L}_{SDS}^{dir}$),在优化过程中保留面部表情与颜色等语义细节。
- 应用基于重建的正则化($\mathcal{L}_{SDS}^{rec}$),以维持结构保真度并减少模糊,尤其在结合层选择时效果更佳。
- 在 SDS 微调中采用层选择策略,通过聚焦于特定特征层来减少模糊并增强细节保留。
- 通过 SDS 采样步数 $T_{SDS}$ 控制图像修改的幅度,较高值支持全局结构变化,较低值则更注重保留局部细节。
- 通过冻结除三平面卷积层外的所有参数,并引入 LPIPS 损失以保持几何保真度,将框架扩展至 3D 感知生成器(EG3D)。
实验结果
研究问题
- RQ1预训练扩散模型能否作为有效且高质量的判别器,在无需真实目标领域图像的情况下指导 GAN 生成器的自适应?
- RQ2在零样本领域自适应中,基于扩散的引导相较于 CLIP 引导在图像质量、多样性与可控性方面表现如何?
- RQ3在自适应过程中,$T_{SDS}$ 的选择在控制结构变化与局部细节修改程度方面起什么作用?
- RQ4扩散引导正则化是否能有效防止模型崩溃并保留如面部表情与颜色等语义细节?
- RQ5该方法在多大程度上可扩展至 3D 感知生成器及如 DreamBooth 的个性化扩散模型?
主要发现
- 所提方法在短提示下的 FID 分数显著低于先前工作,甚至在未最小化 CLIP 损失的情况下也表现出更优的图像质量。
- 在长且复杂的提示下,该方法在定性与定量评估中均优于基线模型,生成的图像更具连贯性与多样性。
- 扩散引导方向性正则化($\mathcal{L}_{SDS}^{dir}$)可加速收敛至目标风格,并保留面部细节如表情与耳饰,而无正则化的基线模型则退化为单一暗色图像。
- SDS 微调中的层选择可减少模糊并增强细节保留,选择的层越少,图像越清晰,发丝细节保真度越高。
- 重建正则化($\mathcal{L}_{SDS}^{rec}$)能更好地保持结构细节,但限制了颜色变化;而 $\mathcal{L}_{SDS}^{dir}$ 允许更多颜色变化,代价是轻微降低细节保真度。
- 该方法成功扩展至 3D 感知生成器(EG3D),生成的网格几何更平滑,眼周区域更大,且与文本提示高度匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。