Skip to main content
QUICK REVIEW

[论文解读] Feature Quantization Improves GAN Training

Yang Zhao, Chunyuan Li|arXiv (Cornell University)|Apr 5, 2020
Generative Adversarial Networks and Image Synthesis参考文献 40被引用 14
一句话总结

本文提出特征量化(FQ)用于生成对抗网络(GANs),其中判别器使用近期特征原型的动态、移动平均字典,将真实与生成特征量化为离散标记。通过在共享离散空间中实现鲁棒且紧凑的特征匹配,FQ 稳定了训练过程并提升了生成质量,在多个 GAN 架构与基准测试中实现了最先进(SOTA)的 FID 分数,包括在 FFHQ 数据集上实现 3.19 FID 的 StyleGAN2,以及在图像翻译任务中表现优异的 U-GAT-IT。

ABSTRACT

The instability in GAN training has been a long-standing problem despite remarkable research efforts. We identify that instability issues stem from difficulties of performing feature matching with mini-batch statistics, due to a fragile balance between the fixed target distribution and the progressively generated distribution. In this work, we propose Feature Quantization (FQ) for the discriminator, to embed both true and fake data samples into a shared discrete space. The quantized values of FQ are constructed as an evolving dictionary, which is consistent with feature statistics of the recent distribution history. Hence, FQ implicitly enables robust feature matching in a compact space. Our method can be easily plugged into existing GAN models, with little computational overhead in training. We apply FQ to 3 representative GAN models on 9 benchmarks: BigGAN for image generation, StyleGAN for face synthesis, and U-GAT-IT for unsupervised image-to-image translation. Extensive experimental results show that the proposed FQ-GAN can improve the FID scores of baseline methods by a large margin on a variety of tasks, achieving new state-of-the-art performance.

研究动机与目标

  • 解决由非平稳小批量统计量引起的 GAN 训练不稳定性问题。
  • 克服依赖当前小批量统计量进行特征匹配的局限性,该局限性导致泛化能力差和训练发散。
  • 开发一种方法,在不增加计算开销的前提下,实现在高维、大规模数据集中的稳定、鲁棒特征匹配。
  • 在多种 GAN 架构与任务(包括图像生成、人脸合成和图像翻译)中,提升训练收敛性与样本质量。

提出的方法

  • 从近期训练历史中构建一个动态、移动平均的特征原型字典,结合真实与生成样本。
  • 将判别器中的连续特征图量化为来自动态演化的字典中的离散标记,从而将特征映射到共享的离散表示。
  • 以量化后的特征作为对抗损失的基础,在紧凑且稳定的特征空间中实现隐式特征匹配。
  • 以极小的架构改动和可忽略的计算成本,将 FQ 模块集成到现有 GAN 判别器中。
  • 通过指数移动平均更新机制,保持字典的一致性,确保其与当前数据分布保持对齐。
  • 将 FQ 模块应用于多种 GAN 变体,包括 BigGAN、StyleGAN、StyleGAN2 和 U-GAT-IT,且无需超参数调优。

实验结果

研究问题

  • RQ1将特征量化到共享离散空间是否能通过缓解非平稳小批量统计量带来的不稳定性,从而稳定 GAN 训练?
  • RQ2使用动态、移动平均的特征原型字典是否能提升在高维、大规模数据集中的特征匹配鲁棒性?
  • RQ3FQ 是否可普遍应用于现有 GAN 模型,以在不改变架构的前提下提升训练稳定性和生成质量?
  • RQ4FQ 在多种 GAN 任务(包括图像生成、人脸合成和图像翻译)中,对样本质量与收敛速度的提升程度如何?
  • RQ5FQ 是否在 ImageNet、FFHQ 和图像翻译数据集等标准基准上实现了最先进性能?

主要发现

  • FQ-GAN 在 9 个基准测试中大幅提升了 FID 分数,在除一个数据集外的所有数据集中均实现了新的最先进性能。
  • 在 FFHQ 数据集上,FQ-StyleGAN2 达到 3.19 的 FID 分数,优于标准 StyleGAN2 报告的 3.31 分数。
  • FQ 在全部五个图像翻译数据集上均提升了 U-GAT-IT 表现,取得最佳 KID 分数,并在感知评估中获得更高的人类偏好(例如,在 selfie2anime 数据集中偏好度达 78%)。
  • FQ 版本的 BigGAN 在 ImageNet 上实现了新的 SOTA FID 分数,表明其在多样化架构与任务中均保持一致的性能增益。
  • 定性结果表明,由于语义一致且有意义的字典项(如天空、草地、鸟颈等)在图像间被重复使用,FQ 生成了更清晰的图像区域。
  • 该方法实现了更快的收敛速度与更稳定的训练过程,因为判别器的特征匹配对小批量方差的敏感性降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。