Skip to main content
QUICK REVIEW

[论文解读] Wasserstein Divergence for GANs

Jiqing Wu, Zhiwu Huang|arXiv (Cornell University)|Dec 4, 2017
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本文提出了一种新型的Wasserstein散度(W-div),该方法放松了传统Wasserstein GAN(WGAN)所需的严格k-Lipschitz约束,从而实现了更稳定的训练。该方法引入了WGAN-div,一种使用W-div作为目标函数的GAN框架,在多个基准测试中实现了最先进的图像生成性能,包括在CelebA-HQ和LSUN数据集上采用渐进式训练,显著提升了FID分数和图像质量。

ABSTRACT

In many domains of computer vision, generative adversarial networks (GANs) have achieved great success, among which the family of Wasserstein GANs (WGANs) is considered to be state-of-the-art due to the theoretical contributions and competitive qualitative performance. However, it is very challenging to approximate the $k$-Lipschitz constraint required by the Wasserstein-1 metric~(W-met). In this paper, we propose a novel Wasserstein divergence~(W-div), which is a relaxed version of W-met and does not require the $k$-Lipschitz constraint. As a concrete application, we introduce a Wasserstein divergence objective for GANs~(WGAN-div), which can faithfully approximate W-div through optimization. Under various settings, including progressive growing training, we demonstrate the stability of the proposed WGAN-div owing to its theoretical and practical advantages over WGANs. Also, we study the quantitative and visual performance of WGAN-div on standard image synthesis benchmarks of computer vision, showing the superior performance of WGAN-div compared to the state-of-the-art methods.

研究动机与目标

  • 解决由于判别器上严格的k-Lipschitz约束带来的WGAN训练不稳定性问题。
  • 设计一种松弛的散度度量方法,在保持Wasserstein度量理论优势的同时,具备实际可优化性。
  • 通过渐进式训练在高分辨率图像生成中实现更稳定的训练动态和更优性能。
  • 提供一种理论基础坚实的对称散度,支持在GAN训练中通过优化实现忠实逼近。

提出的方法

  • 提出一种新的散度度量——Wasserstein散度(W-div),定义为C¹函数上真实与生成数据分布期望差值的下确界,并附加对梯度范数的惩罚项。
  • 引入涉及判别器函数梯度Lp范数的惩罚项,通过超参数k进行缩放,以实现平滑性约束,而无需强制满足严格的1-Lipschitz条件。
  • 将WGAN-div目标函数形式化为基于W-div的极小化-极大化优化问题,其中判别器被训练以最小化W-div的近似值。
  • 采用一种插值策略,在真实与生成数据点之间进行采样,以估计梯度惩罚项,确保优化的有效性。
  • 在渐进式训练框架中应用WGAN-div框架,以生成高分辨率图像(如256×256)。
  • 通过实验验证该方法在不同插值分布Pu采样策略下的鲁棒性。

实验结果

研究问题

  • RQ1能否设计一种松弛的散度度量,使其在保留Wasserstein度量理论优势的同时,避免对严格k-Lipschitz约束的依赖?
  • RQ2与标准WGAN相比,所提出的W-div是否能带来更稳定的GAN训练动态?
  • RQ3在渐进式训练下,WGAN-div在高分辨率图像生成中的表现如何?
  • RQ4插值分布Pu的采样策略选择在多大程度上影响WGAN-div的最终性能?
  • RQ5WGAN-div能否在标准图像生成基准测试中实现最先进的定量与定性结果?

主要发现

  • 在使用策略(1)的CelebA-HQ数据集上,WGAN-div的Fréchet Inception Distance(FID)达到14.9,优于WGAN-GP(17.0)和CTGAN(17.5),在所有测试策略中均表现更优。
  • 在CelebA-HQ和LSUN上的视觉结果表明,WGAN-div生成的样本比PGGAN和WGAN-GP更清晰且更具多样性。
  • 该方法在Pu的多种采样策略下均表现出一致的优越性,表明其对插值选择具有鲁棒性且不敏感。
  • 在渐进式训练中,WGAN-div保持了稳定的训练动态,并生成了FID分数更优的256×256高质量图像。
  • 理论分析证实,W-div具有对称性,且当且仅当真实分布与生成分布相等时,其值为零,验证了其作为有效散度的适用性。
  • 所提出的W-div被证明为非正数,且当分布不同时严格为负,确保了有意义的优化信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。