Skip to main content
QUICK REVIEW

[论文解读] A Classification-Based Study of Covariate Shift in GAN Distributions

Shibani Santurkar, Ludwig Schmidt|arXiv (Cornell University)|Nov 2, 2017
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

本文提出一种基于分类的框架,用于量化生成对抗网络(GAN)生成分布中的协变量偏移,识别出模式崩溃和边界失真为关键的多样性损失。通过在数据空间的不同区域(如中心区域与边界区域)训练二分类器以区分真实样本与生成样本,研究发现尽管生成样本具有较强的感知质量,但最先进 GAN 在分布多样性方面,特别是在外围区域,与真实数据相比存在显著不足。

ABSTRACT

A basic, and still largely unanswered, question in the context of Generative Adversarial Networks (GANs) is whether they are truly able to capture all the fundamental characteristics of the distributions they are trained on. In particular, evaluating the diversity of GAN distributions is challenging and existing methods provide only a partial understanding of this issue. In this paper, we develop quantitative and scalable tools for assessing the diversity of GAN distributions. Specifically, we take a classification-based perspective and view loss of diversity as a form of covariate shift introduced by GANs. We examine two specific forms of such shift: mode collapse and boundary distortion. In contrast to prior work, our methods need only minimal human supervision and can be readily applied to state-of-the-art GANs on large, canonical datasets. Examining popular GANs using our tools indicates that these GANs have significant problems in reproducing the more distributional properties of their training dataset.

研究动机与目标

  • 开发一种可扩展的、定量的评估方法,用于衡量 GAN 的分布多样性,超越视觉检查。
  • 识别并度量两种特定形式的多样性损失:模式崩溃与边界失真。
  • 构建一种仅需极少人工监督的框架,适用于 CelebA 和 LSUN 等大规模数据集上的最先进 GAN。
  • 证明 GAN 即使在生成样本看起来逼真时,也往往无法捕捉真实数据的全部多样性。

提出的方法

  • 训练二分类器以区分来自输入空间不同区域(如中心区域与边界区域)的真实数据与 GAN 生成的样本。
  • 通过分类准确率衡量协变量偏移:准确率越高,表示真实数据与生成数据之间的分布差异越大。
  • 定义两种特定形式的偏移:模式崩溃(高密度区域中多样性的损失)与边界失真(低密度、外围区域中多样性的损失)。
  • 在所有 GAN 和数据集中使用相同的分类器架构,以确保可比性与可扩展性。
  • 将该方法应用于在 CelebA 和 LSUN 数据集上训练的五种主流 GAN(如 Progressive GAN、StyleGAN)。
  • 使用一致的指标对 GAN 与真实数据的相对性能进行评估,并对不同分类器架构进行敏感性分析。

实验结果

研究问题

  • RQ1在协变量偏移的度量下,GAN 在多大程度上未能捕捉真实数据分布的全部多样性?
  • RQ2模式崩溃与边界失真如何具体影响 GAN 生成样本的分布保真度?
  • RQ3基于分类的方法是否能以极少人工监督和高可扩展性检测 GAN 中的多样性损失?
  • RQ4GAN 生成数据的多样性与真实数据相比如何,特别是在支持区域的外围部分?

主要发现

  • 所有研究的 GAN 均表现出显著的协变量偏移,表明其与真实数据相比存在严重的分布多样性损失。
  • 模式崩溃是一种普遍问题,GAN 在数据流形的高密度区域无法生成多样化的样本。
  • 边界失真是一种此前被低估的问题,GAN 在数据分布的外围区域表现出显著降低的多样性。
  • GAN 生成数据的多样性与规模小几个数量级的真实数据集相当。
  • 对 GAN 进行过采样无法有效恢复损失的多样性,表明其在分布学习方面存在根本性局限。
  • GAN 生成样本的高感知质量与分布多样性之间无相关性,甚至在某些情况下呈现负相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。