Skip to main content
QUICK REVIEW

[论文解读] SAN: Inducing Metrizability of GAN with Discriminative Normalized Linear Layer

Yuhta Takida, Masaaki Imaizumi|arXiv (Cornell University)|Jan 30, 2023
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本文提出切片对抗网络(SAN),一种简单而有效的 GAN 改进方法,通过确保判别器通过方向最优性、可分性和单射性发挥适当的距离度量作用,从而强制实现可度量性。通过仅修改最后一层全连接层和优化目标,SAN 提升了训练稳定性和性能,在使用 StyleGAN-XL 进行条件生成时,实现了 ImageNet 256×256 的最先进 FID 分数。

ABSTRACT

Generative adversarial networks (GANs) learn a target probability distribution by optimizing a generator and a discriminator with minimax objectives. This paper addresses the question of whether such optimization actually provides the generator with gradients that make its distribution close to the target distribution. We derive metrizable conditions, sufficient conditions for the discriminator to serve as the distance between the distributions by connecting the GAN formulation with the concept of sliced optimal transport. Furthermore, by leveraging these theoretical results, we propose a novel GAN training scheme, called slicing adversarial network (SAN). With only simple modifications, a broad class of existing GANs can be converted to SANs. Experiments on synthetic and image datasets support our theoretical results and the SAN's effectiveness as compared to usual GANs. Furthermore, we also apply SAN to StyleGAN-XL, which leads to state-of-the-art FID score amongst GANs for class conditional generation on ImageNet 256$ imes$256. Our implementation is available on https://ytakida.github.io/san.

研究动机与目标

  • 探究标准 GAN 优化是否能提供减少分布差异的有意义梯度。
  • 识别判别器成为有效距离度量的充分条件——方向最优性、可分性和单射性。
  • 开发一种简单、即插即用的方法,将现有 GAN 转换为可度量模型,而无需对网络架构进行大规模重构。
  • 通过实证验证 SAN 是否能提升合成数据集和真实世界数据集上的训练稳定性和生成质量。
  • 在使用 StyleGAN-XL 的 ImageNet 256×256 类条件生成任务中,实现最先进 FID 性能。

提出的方法

  • 引入函数均值差异(FM∗),并将其与切片最优传输联系起来,形式化可度量性条件。
  • 提出三项可度量性条件:方向最优性(最优梯度方向)、可分性(可区分的分布)和单射性(从特征到输出的唯一映射)。
  • 通过仅修改判别器的最后一直接层并调整最大化目标以强制实现方向最优性,设计出 SAN。
  • 通过极小的架构改动,将 SAN 应用于现有 GAN 模型,包括 DCGAN、BigGAN 和 StyleGAN-XL。
  • 在实际训练中,使用谱归一化和梯度惩罚以增强单射性和训练稳定性。
  • 在合成数据集(高斯混合模型)和真实数据集(CIFAR-10、CelebA、ImageNet)上训练并评估 SAN,采用 FID 和 IS 指标。

实验结果

研究问题

  • RQ1在 GAN 中,判别器在何种条件下可作为生成数据与真实数据分布之间的有效距离度量?
  • RQ2尽管采用极小化-极大化优化,为何标准 GAN 无法提供有意义的梯度信号?
  • RQ3我们能否在不修改生成器或判别器主要组件的前提下,强制实现判别器的方向最优性?
  • RQ4强制实施可度量性条件如何提升训练稳定性和生成质量?
  • RQ5SAN 是否能在大规模条件图像生成任务(如 ImageNet 256×256)中实现最先进性能?

主要发现

  • SAN 在 ImageNet 256×256 类条件生成任务中实现了 4.78 的最先进 FID 分数,优于以往所有 GAN 模型。
  • 在高斯混合模型实验中,仅 SAN 满足可分性,而标准 GAN(包括 WGAN)不满足,这解释了其防止模式崩溃的原因。
  • 使用 ReLU 作为激活函数的 SAN 判别器会出现模式崩溃,但通过使用 Leaky ReLU 或梯度惩罚可有效缓解,证实了单射性的重要性。
  • 在 MNIST 和 CIFAR-10 数据集上,SAN 在铰链损失、饱和损失和非饱和损失下均一致提升了 FID 和 IS 指标。
  • 所提出的 SAN 框架可轻松应用于任何现有 GAN,仅需修改最后一层全连接层和目标函数,改动极小。
  • 实证结果证实,Wasserstein GAN 不满足可分性,这解释了其在模式覆盖中易出现旋转伪影的原因。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。