Skip to main content
QUICK REVIEW

[论文解读] Improving the Speed and Quality of GAN by Adversarial Training

Jiachen Zhong, Xuanqing Liu|arXiv (Cornell University)|Aug 7, 2020
Generative Adversarial Networks and Image Synthesis参考文献 23被引用 14
一句话总结

本文提出 FastGAN,一种简单而高效的训练算法,在不依赖架构创新或复杂正则化的情况下,显著提升了 GAN 的训练速度与图像质量。通过在判别器中引入额外的对抗性训练循环,FastGAN 在仅使用 2–4 块 GPU 的情况下,于 CIFAR10、CIFAR100 和 ImageNet 上实现了当前最优的 Inception Score 与 FID,优于使用普通 ResNet 生成器与判别器的 SNGAN 与 SAGAN。

ABSTRACT

Generative adversarial networks (GAN) have shown remarkable results in image generation tasks. High fidelity class-conditional GAN methods often rely on stabilization techniques by constraining the global Lipschitz continuity. Such regularization leads to less expressive models and slower convergence speed; other techniques, such as the large batch training, require unconventional computing power and are not widely accessible. In this paper, we develop an efficient algorithm, namely FastGAN (Free AdverSarial Training), to improve the speed and quality of GAN training based on the adversarial training technique. We benchmark our method on CIFAR10, a subset of ImageNet, and the full ImageNet datasets. We choose strong baselines such as SNGAN and SAGAN; the results demonstrate that our training algorithm can achieve better generation quality (in terms of the Inception score and Frechet Inception distance) with less overall training time. Most notably, our training algorithm brings ImageNet training to the broader public by requiring 2-4 GPUs.

研究动机与目标

  • 为解决 GAN 训练中训练速度、模型表达能力与生成质量之间的权衡,尤其是在计算资源有限的情况下。
  • 消除对计算成本高昂的技术(如谱归一化、大批次训练或 TTUR)的依赖,同时保持或提升性能。
  • 实现在标准硬件(2–4 块 GPU)上高效且高质量的 ImageNet 训练,使先进 GAN 训练对更广泛用户群体更加可及。
  • 证明仅使用普通 ResNet 架构的生成器与判别器,结合新型对抗性训练方案,亦可实现优异性能。

提出的方法

  • 提出一种双循环对抗性训练策略,使判别器在训练中经历额外的对抗性训练阶段,以提升其鲁棒性与泛化能力。
  • 采用改进的损失函数,结合标准 GAN 损失与基于扰动的对抗性目标,增强判别器的稳定性与梯度流动。
  • 在判别器训练期间,使用有界扰动(由 $c_{ ext{max}}$ 控制)的投影梯度下降(PGD)攻击生成对抗性样本。
  • 将改进后的损失函数应用于判别器,使其能够区分真实数据与经过对抗扰动的生成样本,从而提升泛化能力。
  • 通过训练动态隐式实现两时间尺度更新规则,尽管未显式使用 TTUR。
  • 仅依赖标准 ResNet 架构构建生成器与判别器,避免使用自注意力机制、带噪声的跳跃连接或权重归一化。

实验结果

研究问题

  • RQ1在不使用谱归一化、自注意力机制或大批次训练的前提下,基于普通 ResNet 的 GAN 是否能实现高质量图像生成?
  • RQ2为判别器添加辅助对抗性训练循环,是否能同时提升训练速度与生成样本质量?
  • RQ3所提方法是否能在仅使用 2–4 块 GPU 的情况下,实现 ImageNet 的高保真度 GAN 训练,从而降低入门门槛?
  • RQ4在多个数据集上,所提对抗性训练方案与 SNGAN 和 SAGAN 相比,在 FID 与 Inception Score 上表现如何?
  • RQ5超参数 $c_{ ext{max}}$ 对最终生成质量与训练稳定性有何影响?

主要发现

  • 在仅使用 2 块 GPU 的情况下,FastGAN 在 ImageNet-143(128×128)上实现了 14.48 的 Fréchet Inception Distance(FID),优于 SNGAN(FID: 30.83)与 RobGAN(FID: 33.98),且训练时间不足其一半。
  • 在 CIFAR10 上,FastGAN 达到 8.87 的 Inception Score 与 17.27 的 FID,优于基线模型 RobGAN(IS: 6.26,FID: 43.69),且类内多样性更优。
  • 在 CIFAR10 上,FastGAN 每 1000 次迭代的训练速度比 SNGAN 快 3–4 倍(95.5 秒 vs. 245.1 秒),同时性能更优或相当。
  • 在 ImageNet-143(64×64)上,FastGAN 仅用 1 块 GPU 在 36,100 秒内完成训练,而 SNGAN 需要 222,000 秒,实现 6 倍加速,且 FID 更优(12.04 vs. 29.70)。
  • 在 ImageNet-143 上延长 FastGAN 的训练时间可进一步提升性能(IS: 42.91,FID: 11.98),表明在更长训练下仍有进一步提升空间。
  • 消融实验表明,在 CIFAR10 与 CIFAR100 上,$c_{ ext{max}} = 0.006$ 可实现最优性能,兼顾鲁棒性与训练稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。