Skip to main content
QUICK REVIEW

[论文解读] Quality Evaluation of GANs Using Cross Local Intrinsic Dimensionality

Sukarna Barua, Xingjun Ma|arXiv (Cornell University)|May 2, 2019
Generative Adversarial Networks and Image Synthesis参考文献 37被引用 5
一句话总结

本文提出 CrossLID,一种基于交叉局部内在维度的新型 GAN 评估指标,用于衡量真实数据流形与生成数据流形之间的对齐程度。通过估计真实数据相对于生成样本中邻域的局部内在维度,CrossLID 能够有效检测模式崩溃,与训练进度高度相关,并实现稳健、样本高效的生成质量评估,在噪声、图像变换和小样本量条件下,其敏感性和稳定性优于 IS 和 FID。

ABSTRACT

Generative Adversarial Networks (GANs) are an elegant mechanism for data generation. However, a key challenge when using GANs is how to best measure their ability to generate realistic data. In this paper, we demonstrate that an intrinsic dimensional characterization of the data space learned by a GAN model leads to an effective evaluation metric for GAN quality. In particular, we propose a new evaluation measure, CrossLID, that assesses the local intrinsic dimensionality (LID) of real-world data with respect to neighborhoods found in GAN-generated samples. Intuitively, CrossLID measures the degree to which manifolds of two data distributions coincide with each other. In experiments on 4 benchmark image datasets, we compare our proposed measure to several state-of-the-art evaluation metrics. Our experiments show that CrossLID is strongly correlated with the progress of GAN training, is sensitive to mode collapse, is robust to small-scale noise and image transformations, and robust to sample size. Furthermore, we show how CrossLID can be used within the GAN training process to improve generation quality.

研究动机与目标

  • 为解决现有 GAN 生成质量评估中缺乏可靠、定量指标的问题,特别是检测模式崩溃和泛化失败的能力不足。
  • 开发一种对小规模噪声、图像变换和样本数量变化具有鲁棒性的评估指标,以克服 FID 和 IS 等现有指标的常见局限。
  • 实现将内在维度作为基于局部邻域的度量,用于衡量真实数据与生成数据分布之间的对齐程度。
  • 通过一种模式感知的过采样策略,将该指标集成到 GAN 训练中,以提升训练稳定性和生成质量。
  • 为 GAN 评估提供一种比 Inception Score 和 Fréchet Inception Distance 等全局指标更敏感、更可靠的替代方案。

提出的方法

  • 提出 CrossLID 作为局部内在维度(LID)的交叉估计,其中真实数据点的 LID 是基于 GAN 生成样本中的邻域计算得出。
  • 利用 LID 模型基于邻域内概率质量随半径增长的速率,估计每个真实样本周围局部数据子流形的内在维度。
  • 通过以生成样本作为参考邻域,计算真实数据点的平均 LID,以量化真实数据与生成数据分布之间的对齐程度。
  • 将 CrossLID 应用于识别 GAN 输出中覆盖不足的模式,通过计算各模式的 CrossLID 分数,反映每个模式的覆盖程度。
  • 提出一种基于 CrossLID 的引导式过采样策略,提高低覆盖模式的训练频率,从而改善判别器的泛化能力并防止模式崩溃。
  • 采用 k-最近邻(k-NN)方法,利用生成样本潜在空间中的经验距离分布,高效估计 LID 值。

实验结果

研究问题

  • RQ1与全局指标相比,基于局部邻域的内在维度度量是否能有效评估 GAN 生成样本的质量?
  • RQ2CrossLID 对模式崩溃的敏感性如何?能否检测到 GAN 输出中数据模式的不完整覆盖?
  • RQ3与 IS 和 FID 相比,CrossLID 在小规模噪声、图像变换和样本数量变化下的鲁棒性如何?
  • RQ4CrossLID 是否可用于指导训练,通过识别覆盖不足的数据模式,并借助针对性的过采样提升泛化能力?
  • RQ5将 CrossLID 集成到训练循环中是否能带来可测量的 GAN 生成质量提升和训练稳定性改善?

主要发现

  • CrossLID 与 GAN 训练进度高度相关,分数下降表明真实数据与生成数据分布之间的对齐程度提高。
  • CrossLID 对模式崩溃极为敏感:当生成样本仅覆盖双模分布中的一个模式时,其 CrossLID 分数显著升高(例如,图 1 中为 7.33 vs. 2.10)。
  • CrossLID 在小规模输入噪声和图像变换下表现稳健,其稳定性优于 IS 和 FID。
  • CrossLID 在不同样本数量下方差最小,即使在 5K 张样本时仍保持稳定,而 FID 敏感度高,IS 稳定性中等。
  • 在 MNIST、CIFAR-10 和 SVHN 数据集上,CrossLID 引导的过采样策略使 DCGAN 和 WGAN 模型的 CrossLID 分数降低了 0.15–0.22,表明模式覆盖和分布对齐得到改善。
  • 消融实验表明,即使在移除判别器或两个网络中的批量归一化后,CrossLID 引导的训练仍能防止模式崩溃,而标准训练无法生成多样化样本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。