Skip to main content
QUICK REVIEW

[论文解读] A Wasserstein GAN model with the total variational regularization

Lijun Zhang, Yujin Zhang|arXiv (Cornell University)|Dec 3, 2018
Generative Adversarial Networks and Image Synthesis参考文献 14被引用 6
一句话总结

本文提出一种带有全变差(TV)正则化的Wasserstein GAN(TV-WGAN),通过在判别器网络上隐式施加1-Lipschitz约束来提升训练稳定性,替代梯度惩罚或权重裁剪。该方法在多种网络架构中均表现出更优的训练稳定性,减少梯度爆炸现象,并引入一个边缘因子以控制生成图像在多样性与视觉质量之间的权衡,相较于GP-WGAN在稳定性方面表现更优,且在较高边缘值下实现了更高的Inception分数。

ABSTRACT

It is well known that the generative adversarial nets (GANs) are remarkably difficult to train. The recently proposed Wasserstein GAN (WGAN) creates principled research directions towards addressing these issues. But we found in practice that gradient penalty WGANs (GP-WGANs) still suffer from training instability. In this paper, we combine a Total Variational (TV) regularizing term into the WGAN formulation instead of weight clipping or gradient penalty, which implies that the Lipschitz constraint is enforced on the critic network. Our proposed method is more stable at training than GP-WGANs and works well across varied GAN architectures. We also present a method to control the trade-off between image diversity and visual quality. It does not bring any computation burden.

研究动机与目标

  • 为解决基于梯度惩罚的WGAN(GP-WGAN)中长期存在的训练不稳定性问题,特别是在高学习率或同质化网络架构下的情况。
  • 用一种全变差(TV)正则化项替代梯度惩罚或权重裁剪,以隐式地在判别器上施加1-Lipschitz约束。
  • 提出一种简单而有效的方法,在不增加计算成本的前提下,保持在多种GAN架构中的高训练稳定性。
  • 引入一个边缘因子,以实现对生成图像多样性与视觉质量之间权衡的可控调节。

提出的方法

  • 将全变差正则化项引入WGAN的目标函数,以隐式地在判别器网络上施加1-Lipschitz约束。
  • 修改判别器损失函数,加入TV正则化项:$ L = \mathbb{E}[D(x)] - \mathbb{E}[D(G(z))] + \lambda \cdot \text{TV}(D) $,其中TV(D)用于惩罚判别器输出的空间变化。
  • TV正则化作为判别器的平滑先验,降低对梯度噪声的敏感性,防止梯度爆炸。
  • 引入边缘因子 $ \delta $ 作为超参数,通过调整TV项的相对权重,控制图像多样性与视觉质量之间的权衡。
  • 该方法与多种GAN架构兼容,包括DCGAN类和BEGAN类结构,且无需架构修改。
  • 使用Adam优化器以标准超参数进行训练,且不增加额外计算开销。

实验结果

研究问题

  • RQ1全变差正则化是否能在不依赖梯度惩罚或权重裁剪的情况下,有效在WGAN中施加1-Lipschitz约束?
  • RQ2TV正则化是否能提升GP-WGAN的训练稳定性,特别是在高学习率或同质化网络架构下?
  • RQ3与GP-WGAN和BEGAN相比,所提方法是否能在多种GAN架构中保持或提升样本质量与多样性?
  • RQ4边缘因子在控制生成样本中图像多样性与视觉质量之间的权衡方面是否有效?
  • RQ5TV-WGAN是否能在长期训练中避免模式崩溃,特别是在与未使用学习率衰减的BEGAN对比时?

主要发现

  • TV-WGAN在所有测试架构和学习率下均表现出显著优于GP-WGAN的训练稳定性,未观察到梯度爆炸现象。
  • TV-WGAN的Inception分数从δ=0时的4.12提升至δ=10时的4.47,表明更高的边缘值可提升视觉质量并降低方差。
  • TV-WGAN的Inception分数高于GP-WGAN(3.75),并接近DCGAN和BEGAN的性能水平,表明其具有出色的样本质量。
  • 在100个训练周期后,TV-WGAN持续生成高质量图像且未出现模式崩溃,而未使用学习率衰减的BEGAN则出现了模式崩溃。
  • 该方法在多种架构(包括DCGAN类和BEGAN类结构)中均表现出一致性能,且无需架构修改。
  • 边缘因子δ为多样性与质量之间的平衡提供了可控调节手段,且视觉质量随δ值单调提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。