Skip to main content
QUICK REVIEW

[论文解读] Understanding the (un)interpretability of natural image distributions using generative models

Ryen Krusinga, Sohil Shah|arXiv (Cornell University)|Jan 6, 2019
Generative Adversarial Networks and Image Synthesis参考文献 26被引用 10
一句话总结

本文研究了生成模型在自然图像分布上学习的概率密度函数的可解释性。提出不在像素空间而是在 GAN 的潜在空间中估计密度,其中距离与语义相似性相关联,从而产生直观的内点和外点——表明潜在空间中的密度远比像素空间中的密度更具可解释性。

ABSTRACT

Probability density estimation is a classical and well studied problem, but standard density estimation methods have historically lacked the power to model complex and high-dimensional image distributions. More recent generative models leverage the power of neural networks to implicitly learn and represent probability models over complex images. We describe methods to extract explicit probability density estimates from GANs, and explore the properties of these image density functions. We perform sanity check experiments to provide evidence that these probabilities are reasonable. However, we also show that density functions of natural images are difficult to interpret and thus limited in use. We study reasons for this lack of interpretability, and show that we can get interpretability back by doing density estimation on latent representations of images.

研究动机与目标

  • 研究为何即使使用强大的 GAN 学习到的自然图像分布的概率密度估计,在像素空间中也难以解释。
  • 探索在 GAN 的潜在空间中进行密度估计是否能通过将密度与语义相似性对齐来恢复可解释性。
  • 评估潜在空间中高概率和低概率图像是否与典型的典型性和异常性的直观概念相符。
  • 比较像素空间与潜在空间密度估计器在捕捉语义结构和分布模式方面的行为。

提出的方法

  • 提出一种方法,通过利用生成图像的潜在码 z 从 GAN 中提取显式概率密度估计,使用雅可比行列式来校正从 z 到图像空间的非双射映射。
  • 训练一个回归器,基于其潜在码 z 预测任意图像的概率,从而在潜在空间上有效学习一个密度函数。
  • 使用非双射映射的标准变量变换公式,通过 z 的高斯先验和生成器的雅可比行列式来近似密度。
  • 通过比较真实图像与生成图像的概率,并分析高概率和低概率样本的视觉质量,进行合理性检查。
  • 使用直方图分布和内点/外点的视觉检查等指标,比较像素空间与潜在空间的密度估计。
  • 使用预训练的 GAN(例如,CUB 上的 StackGAN,CIFAR/MNIST 上的 StyleGAN)提取潜在码,并评估不同领域之间的密度一致性。

实验结果

研究问题

  • RQ1为何像素空间中高概率的图像通常表现为简单、孤立的物体(如单个 '1' 数字),且具有大面积均匀背景,与典型的直观预期相悖?
  • RQ2在 GAN 的潜在空间中进行密度估计是否能产生与语义内容一致的、更具可解释性的内点和外点?
  • RQ3为何 GAN 对 MNIST 数字(尤其是 '1')的赋值概率高于许多真实 CIFAR-10 图像,尽管从未见过它们?
  • RQ4像素空间中密度缺乏可解释性是否源于欧氏距离与语义相似性之间的不匹配?
  • RQ5潜在空间中的密度估计能否恢复更直观的分布外点概念,例如语义异常的图像?

主要发现

  • 在像素空间中概率最高的图像通常为简单、孤立的物体(如单个 '1' 数字),且具有大面积均匀背景,与直观的典型性预期相悖。
  • 像素空间中低概率图像常表现出语义异常,如不自然的物体构型(如引擎盖打开的汽车)或奇怪的背景(如飞机图像中的绿色天空)。
  • 即使在 CIFAR-10 上进行训练,GAN 对 MNIST 数字的概率赋值也高于大多数 CIFAR-10 图像,表明像素空间中的密度未反映语义分布结构。
  • 相比之下,潜在空间中的密度估计产生了更均匀的概率分布,并在以 CIFAR-10 训练时,正确地将 CIFAR-10 图像识别为内点,MNIST 图像识别为外点。
  • 潜在空间中最可能的图像在不同类别间表现出多样性,且语义连贯,高概率与清晰定义、突出的前景物体相关联。
  • 潜在空间中最不可能的图像表现出语义异常——如物体处于不寻常姿态或背景不一致等——证实模型捕捉到了有意义的外点行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。