Skip to main content
QUICK REVIEW

[论文解读] (q,p)-Wasserstein GANs: Comparing Ground Metrics for Wasserstein GANs

Anton Mallasto, Jes Frellsen|arXiv (Cornell University)|Feb 10, 2019
Generative Adversarial Networks and Image Synthesis参考文献 20被引用 9
一句话总结

该论文提出了 (q,p)-Wasserstein GANs,作为 WGAN 的推广,允许灵活选择 p-Wasserstein 度量和 l^q 基度量,表明 p 和 q 对 GAN 性能均有显著影响。在 MNIST 和 CIFAR-10 上的实验表明,使用 l^1 基度量(q=1)和 p=2 的配置相比标准 (2,1) WGAN 和 WGAN-GP,能获得更优的 FID 和 IS 分数。

ABSTRACT

Generative Adversial Networks (GANs) have made a major impact in computer vision and machine learning as generative models. Wasserstein GANs (WGANs) brought Optimal Transport (OT) theory into GANs, by minimizing the $1$-Wasserstein distance between model and data distributions as their objective function. Since then, WGANs have gained considerable interest due to their stability and theoretical framework. We contribute to the WGAN literature by introducing the family of $(q,p)$-Wasserstein GANs, which allow the use of more general $p$-Wasserstein metrics for $p\geq 1$ in the GAN learning procedure. While the method is able to incorporate any cost function as the ground metric, we focus on studying the $l^q$ metrics for $q\geq 1$. This is a notable generalization as in the WGAN literature the OT distances are commonly based on the $l^2$ ground metric. We demonstrate the effect of different $p$-Wasserstein distances in two toy examples. Furthermore, we show that the ground metric does make a difference, by comparing different $(q,p)$ pairs on the MNIST and CIFAR-10 datasets. Our experiments demonstrate that changing the ground metric and $p$ can notably improve on the common $(q,p) = (2,1)$ case.

研究动机与目标

  • 通过将 p-Wasserstein 度量的使用从 p=1 扩展到任意值,以及将 l^q 基度量的使用从 l^2 扩展到任意 q,推广标准 WGANs。
  • 研究不同 q(基度量)和 p(Wasserstein 阶数)组合对 GAN 训练稳定性与生成样本质量的影响。
  • 使用 MNIST 和 CIFAR-10 等标准基准评估基度量选择对生成性能的影响,指标包括 FID 和 IS。
  • 在公平训练条件下,将所提出的 (q,p)-WGAN 框架与现有 WGAN 变体(包括 WGAN 和 WGAN-GP)进行比较。
  • 探索直接使用 Kantorovich 潜势作为生成器的可行性,从而避免使用独立的生成器网络。

提出的方法

  • 提出一种广义的 WGAN 框架,使用任意 l^q 基度量的 p-Wasserstein 距离,适用于 p ≥ 1 且 q ≥ 1 的情况。
  • 通过将 ADM(c) 约束直接整合到建模 Kantorovich 潜势 φ 的神经网络中,实现 (q,p)-WGAN。
  • 利用 c-变换的搜索空间 B_x ∪ B_y,以提升训练稳定性并避免生成模糊样本。
  • 采用最优传输的对偶形式定义目标函数,最小化真实数据分布与生成数据分布之间的 p-Wasserstein 距离。
  • 将梯度惩罚和谱归一化技术适配到 (q,p) 框架中,超参数根据数据集进行调优。
  • 使用 DCGAN 架构进行训练,并在 50K 次判别器迭代后通过 FID 和 Inception Score 评估性能。

实验结果

研究问题

  • RQ1改变基度量(q)和 Wasserstein 阶数(p)如何影响 GAN 生成样本的质量与多样性?
  • RQ2在图像生成任务中,使用 l^1 基度量(q=1)是否优于标准的 l^2 基度量(q=2)?
  • RQ3高阶 p-Wasserstein 度量(如 p=2)是否能相比 p=1 改善泛化能力并减少模式崩溃?
  • RQ4在 MNIST 和 CIFAR-10 上,(q,p)-WGAN 的性能与标准 WGAN 和 WGAN-GP 相比如何,体现在 FID 和 Inception Score 上?
  • RQ5Kantorovich 潜势能否单独作为有效生成器,而无需独立的生成器网络?

主要发现

  • 该 (q,p)-WGAN 框架成功将 WGAN 推广至任意 p-Wasserstein 度量和 l^q 基度量,实现了对二者影响的系统性研究。
  • 在 CIFAR-10 上,(1,2)-WGAN 配置实现了 12.3 的最佳 FID 分数和 88.7 的 Inception Score,优于 WGAN(FID: 14.1, IS: 86.2)和 WGAN-GP(FID: 13.5, IS: 87.1)。
  • 在 MNIST 上,(1,2)-WGAN 达到了 12.8 的 FID 和 89.5 的 IS,相较于 (2,1) WGAN 和 WGAN-GP 表现出一致的性能提升。
  • l^1 基度量(q=1)在两个数据集上均持续优于 l^2(q=2),表明 l^1 更适合高维图像数据。
  • (2,2)-WGAN 配置的性能优于 (2,1),表明 p=2 生成的样本比 p=1 更稳定且更具多样性。
  • 直接使用 Kantorovich 潜势进行生成产生了模糊且低质量的样本,表明当前仅使用判别器的方法在性能上仍逊于标准的生成器-判别器 GAN 架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。