Skip to main content
QUICK REVIEW

[论文解读] Normalizing Flows Across Dimensions

Edmond Cunningham, Renos Zabounidis|arXiv (Cornell University)|Jun 23, 2020
Generative Adversarial Networks and Image Synthesis参考文献 24被引用 6
一句话总结

本文提出噪声注入流(Noisy Injective Flows, NIF),作为归一化流的泛化形式,通过使用单射变换和随机噪声模型,实现对低维数据流形的学习。NIF 通过可调噪声参数允许对流形的受控偏离,在保持精确对数似然计算的同时,提升了生成样本的质量和 FID 分数。

ABSTRACT

Real-world data with underlying structure, such as pictures of faces, are hypothesized to lie on a low-dimensional manifold. This manifold hypothesis has motivated state-of-the-art generative algorithms that learn low-dimensional data representations. Unfortunately, a popular generative model, normalizing flows, cannot take advantage of this. Normalizing flows are based on successive variable transformations that are, by design, incapable of learning lower-dimensional representations. In this paper we introduce noisy injective flows (NIF), a generalization of normalizing flows that can go across dimensions. NIF explicitly map the latent space to a learnable manifold in a high-dimensional data space using injective transformations. We further employ an additive noise model to account for deviations from the manifold and identify a stochastic inverse of the generative process. Empirically, we demonstrate that a simple application of our method to existing flow architectures can significantly improve sample quality and yield separable data embeddings.

研究动机与目标

  • 为解决归一化流在学习低维数据流形方面的局限性,该局限性阻碍了高质量图像生成。
  • 在保持可逆性和精确对数似然计算的前提下,实现归一化流中的维度跨越变换。
  • 为位于但不完全位于低维流形附近的概率数据提供一种系统性建模方法。
  • 为推理和训练开发一种随机逆模型,支持灵活采样并提升生成性能。
  • 证明在采样过程中引入受控噪声可提升 FID 分数,而不会降低对数似然。

提出的方法

  • NIF 使用单射、降维变换,将低维潜在空间映射到高维数据空间中的学习流形。
  • 引入随机噪声模型,以解释偏离学习流形的数据点,从而支持对含噪声的真实世界数据进行建模。
  • 该方法定义了生成过程的随机逆,支持在概率上严谨的框架下进行训练和推理。
  • 单一标量参数 $ s $ 控制最后一层的噪声方差,支持对生成样本清晰度和质量的后期调优。
  • 该框架与现有归一化流架构兼容,可作为即插即用的增强模块。
  • 通过使用变量变换公式的变化下界,即使在单射但非双射映射下,也能实现最大似然训练。

实验结果

研究问题

  • RQ1能否将归一化流泛化为在保持精确对数似然计算的同时学习低维数据流形?
  • RQ2如何以一种能提升样本质量和生成性能的方式建模对学习流形的偏离?
  • RQ3能否为单射流定义一种随机逆,以系统性地支持训练和推理?
  • RQ4在采样过程中引入受控噪声是否能提升 FID 分数而不降低对数似然?
  • RQ5能否使用相同的模型架构生成位于流形上的清晰图像和偏离流形的多样化样本?

主要发现

  • 在 CelebA 数据集上,NIF 的 Fréchet Inception Distance (FID) 达到 30.96,显著优于基线归一化流(63.07),且潜在维度为 128。
  • 在 Fashion MNIST 上,NIF 的 FID 为 23.23,而基线归一化流为 42.77,表明样本质量有显著提升。
  • 模型保持或略微改善了对数似然性能,CelebA 上 NIF-128 的 bits per dimension 值为 0.835,优于基线归一化流的 0.852。
  • FID 分数在非零噪声水平下达到最小值(例如,$ s \approx 0.5 $),表明对流形的小幅偏离可提升基于分类器的指标。
  • 在流形上直接生成的样本($ s = 0.0 $)在视觉上比标准归一化流生成的样本更清晰、更连贯。
  • 该方法在多个数据集(包括 CIFAR-10 和 Fashion MNIST)上均表现出一致的性能提升,且超参数调优极少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。