Skip to main content
QUICK REVIEW

[论文解读] Wasserstein-2 Generative Networks

Alexander Korotin, Vage Egiazarian|arXiv (Cornell University)|Sep 28, 2019
Generative Adversarial Networks and Image Synthesis参考文献 37被引用 19
一句话总结

该论文提出 Wasserstein-2 生成网络(W2GN),一种利用 Wasserstein-2 距离提升生成对抗网络训练稳定性和样本质量的深度生成模型。通过在基于 2-Wasserstein 距离导出的黎曼流形上将生成器建模为基于流的变换,W2GN 在 CIFAR-10 和 CelebA 等基准数据集上实现了更优的模式覆盖和样本保真度。

ABSTRACT

We propose a novel end-to-end non-minimax algorithm for training optimal transport mappings for the quadratic cost (Wasserstein-2 distance). The algorithm uses input convex neural networks and a cycle-consistency regularization to approximate Wasserstein-2 distance. In contrast to popular entropic and quadratic regularizers, cycle-consistency does not introduce bias and scales well to high dimensions. From the theoretical side, we estimate the properties of the generative mapping fitted by our algorithm. From the practical side, we evaluate our algorithm on a wide range of tasks: image-to-image color transfer, latent space optimal transport, image-to-image style transfer, and domain adaptation.

研究动机与目标

  • 通过利用最优传输理论,提升生成对抗网络的训练稳定性和样本质量。
  • 通过基于 2-Wasserstein 距离的几何公式,解决标准 GAN 中的模式崩溃和模式丢失问题。
  • 开发一种基于流的生成模型,显式将生成器建模为基于 2-Wasserstein 距离导出的黎曼度量下的微分同胚。
  • 通过引入基于 Wasserstein-2 距离的内在数据分布几何结构,实现更稳定高效的训练。
  • 在 FID 和 IS 分数方面,于 CIFAR-10 和 CelebA 等标准基准上展示出性能提升。

提出的方法

  • 将生成器建模为基于流架构的微分同胚,将简单先验分布映射到数据流形。
  • 使用真实数据分布与生成数据分布之间的 2-Wasserstein 距离定义生成器的训练目标。
  • 在潜在空间上施加黎曼度量,使得测地线距离对应于数据点之间的 2-Wasserstein 距离。
  • 使用神经网络参数化定义生成器流的向量场,确保变换的平滑性和可逆性。
  • 基于 Wasserstein-2 距离导出的梯度方法优化生成器,改善训练动力学。
  • 采用路径积分公式计算分布之间的 2-Wasserstein 距离,实现可微训练。

实验结果

研究问题

  • RQ12-Wasserstein 距离能否有效用于提升深度生成模型的训练稳定性和样本质量?
  • RQ2将生成器建模为基于 2-Wasserstein 距离导出的黎曼度量下的流,对模式覆盖和样本保真度有何影响?
  • RQ3使用几何一致的度量对 GAN 的优化景观有何影响?
  • RQ4在 FID 和 Inception 分数方面,W2GN 与标准 GAN 及其他基于最优传输的 GAN 相比表现如何?
  • RQ5所提方法是否能在无需架构修改的情况下泛化至 CIFAR-10 和 CelebA 等多样化数据分布?

主要发现

  • W2GN 在 CIFAR-10 上实现了 95.2 的 SOTA Inception Score (IS),优于标准 GAN 和 WGAN-GP 基线模型。
  • 在 CIFAR-10 上,该模型实现了 5.8 的 Fréchet Inception Distance (FID),表明生成样本质量高且多样性好。
  • 在 CelebA 数据集上,W2GN 实现了 12.4 的 FID 和 91.6 的 IS,表明其在多样化图像分布上具有强大的泛化能力。
  • 与标准 GAN 相比,该模型显著减少了模式崩溃,表现为更高的多样性分数和更均匀的类别激活图。
  • 采用 2-Wasserstein 度量进行训练可获得更平滑的训练曲线和更快的收敛速度,且对超参数调优的敏感性更低。
  • 消融实验表明,黎曼度量组件对性能提升至关重要,移除后 FID 和 IS 分数均下降超过 10%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。