Skip to main content
QUICK REVIEW

[论文解读] Alleviating Mode Collapse in GAN via Diversity Penalty Module

Sen Pei, Richard Yi Da Xu|arXiv (Cornell University)|Aug 5, 2021
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 10
一句话总结

本文提出一种可插拔的多样性惩罚模块(PDPM),通过强制隐空间向量相似性与生成图像特征相似性之间的一致性,缓解生成对抗网络(GAN)中的模式崩溃问题。通过使用归一化的格拉姆矩阵衡量特征相似性,并对不匹配的相似性施加惩罚,PDPM 提升了模式覆盖度、图像质量以及在图像生成、数据增强和域迁移等多样化任务中的泛化能力,在计算开销极小的情况下实现了最先进性能。

ABSTRACT

The vanilla GAN (Goodfellow et al. 2014) suffers from mode collapse deeply, which usually manifests as that the images generated by generators tend to have a high similarity amongst them, even though their corresponding latent vectors have been very different. In this paper, we introduce a pluggable diversity penalty module (DPM) to alleviate mode collapse of GANs. It reduces the similarity of image pairs in feature space, i.e., if two latent vectors are different, then we enforce the generator to generate two images with different features. The normalized Gram matrix is used to measure the similarity. We compare the proposed method with Unrolled GAN (Metz et al. 2016), BourGAN (Xiao, Zhong, and Zheng 2018), PacGAN (Lin et al. 2018), VEEGAN (Srivastava et al. 2017) and ALI (Dumoulin et al. 2016) on 2D synthetic dataset, and results show that the diversity penalty module can help GAN capture much more modes of the data distribution. Further, in classification tasks, we apply this method as image data augmentation on MNIST, Fashion- MNIST and CIFAR-10, and the classification testing accuracy is improved by 0.24%, 1.34% and 0.52% compared with WGAN GP (Gulrajani et al. 2017), respectively. In domain translation, diversity penalty module can help StarGAN (Choi et al. 2018) generate more accurate attention masks and accelarate the convergence process. Finally, we quantitatively evaluate the proposed method with IS and FID on CelebA, CIFAR-10, MNIST and Fashion-MNIST, and the results suggest GAN with diversity penalty module gets much higher IS and lower FID compared with some SOTA GAN architectures.

研究动机与目标

  • 为解决 GAN 中长期存在的模式崩溃问题,即生成器尽管输入多样化的隐向量,却仍生成高度相似的样本。
  • 开发一种可泛化的、与架构无关的模块,无需修改 GAN 架构即可提升训练稳定性和多样性。
  • 在特征空间而非像素空间中,强制隐向量相似性与生成图像特征相似性之间的一致性。
  • 在下游任务(如数据增强和域迁移)中实现 GAN 的有效应用,提升样本质量和多样性。

提出的方法

  • PDPM 使用归一化的格拉姆矩阵计算隐向量之间的相似性,以建立参考相似性分布。
  • 从判别器中提取生成图像的特征图,并计算其归一化的格拉姆矩阵,以度量特征层面的相似性。
  • 该方法强制要求:若两个隐向量不相似,则其对应的生成图像必须具有不相似的特征,通过多样性惩罚项来惩罚违反此规则的情况。
  • 惩罚项在生成器训练过程中通过平衡系数 λ 应用,除该标量外不引入额外参数。
  • 该框架设计为即插即用模块,兼容多种 GAN 架构,包括 DCGAN、WGAN-GP 和 StarGAN。
  • 其在特征空间中运行,相比像素空间更具鲁棒性,避免了其他方法中常见的噪声像素生成问题。

实验结果

研究问题

  • RQ1能否设计一种通用模块,在不修改底层架构的前提下缓解 GAN 中的模式崩溃?
  • RQ2强制隐向量相似性与生成图像特征相似性之间的一致性,是否能提升模式覆盖度与样本多样性?
  • RQ3基于特征空间的惩罚机制是否能在图像质量与多样性方面超越现有的损失函数设计或架构修改方法?
  • RQ4所提出的模块在数据增强和域迁移等下游任务中的有效性如何?
  • RQ5PDPM 模块是否在不同 GAN 架构与数据集上均保持高性能?

主要发现

  • 在 CelebA 数据集上,PDPM 在 DCGAN 上实现了 21.76 的 FID 得分,在 WGAN-GP 上实现了 24.18,显著优于原始 GAN 及其他最先进方法。
  • 在 2D 合成数据集上,使用 PDPM 的 GAN 比原始 GAN 多捕获了四个模式,展现出更优的模式覆盖能力。
  • 在图像数据增强任务中,PDPM 在 MNIST 上使 ResNet 准确率提升 0.24%,在 Fashion-MNIST 上提升 1.33%,在 CIFAR-10 上提升 0.55%,均优于 WGAN-GP。
  • 潜在空间中的线性插值显示,PDPM 生成的过渡更加平滑,且无噪声像素,而 MS 正则化组则存在此问题。
  • 在域迁移任务中,PDPM 实现了更快的收敛速度,并生成了更准确的注意力掩码,相较于原始 StarGAN 在面部属性迁移任务中表现更优。
  • PDPM 模块在多种任务中均表现出色——包括图像生成、数据增强和域迁移——展现出强大的可迁移性与极低的计算成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。