Skip to main content
QUICK REVIEW

[论文解读] Regularized Autoencoders via Relaxed Injective Probability Flow

Abhishek Kumar, Ben Poole|arXiv (Cornell University)|Feb 20, 2020
Generative Adversarial Networks and Image Synthesis参考文献 36被引用 10
一句话总结

本文提出Injective Flow,一种生成模型,通过使用从低维潜在空间到高维数据的单射映射,放宽了可逆流模型对双射性的约束,从而实现通过下界概率流的可 tractable 训练。该方法在样本质量上优于 VAE 和自编码器,在 CIFAR-10 和 CelebA 上实现了最先进 FID 分数,同时保持了压缩的潜在空间。

ABSTRACT

Invertible flow-based generative models are an effective method for learning to generate samples, while allowing for tractable likelihood computation and inference. However, the invertibility requirement restricts models to have the same latent dimensionality as the inputs. This imposes significant architectural, memory, and computational costs, making them more challenging to scale than other classes of generative models such as Variational Autoencoders (VAEs). We propose a generative model based on probability flows that does away with the bijectivity requirement on the model and only assumes injectivity. This also provides another perspective on regularized autoencoders (RAEs), with our final objectives resembling RAEs with specific regularizers that are derived by lower bounding the probability flow objective. We empirically demonstrate the promise of the proposed model, improving over VAEs and AEs in terms of sample quality.

研究动机与目标

  • 为解决由于双射性约束导致输入与潜在空间维度必须相等,从而造成可逆流模型计算和内存成本过高的问题。
  • 通过将双射性放松为单射性,实现高效、可扩展的生成建模,并保持压缩的潜在空间。
  • 从概率流中推导出一个可 tractable 的训练目标,该目标自然地引出正则化自编码器中使用的正则化策略。
  • 在保持低维潜在空间的同时,相比 VAE 和标准自编码器,提升样本质量和 FID 分数。
  • 通过将正则化自编码器与概率流目标联系起来,并推导出相应的正则化项,为正则化自编码器提供新的视角。

提出的方法

  • 使用从 $ \mathbb{R}^d $ 到 $ \mathbb{R}^D $ 的单射、可微映射 $ g $,其中 $ g $ 仅在其像集 $ g(Z) $ 上可逆。
  • 应用单射映射的变量变换公式,推导出涉及雅可比行列式 $ \left| \det J_g(z)^\top J_g(z) \right|^{1/2} $ 的对数似然表达式。
  • 通过随机近似方法,对雅可比项进行处理,从而为优化提供可 tractable 的概率流目标下界。
  • 采用摊销编码器并结合惩罚方法,在训练过程中强制实现单射性,近似满足 $ g(h(x)) \approx x $ 于训练样本点。
  • 在概率流框架下自然地引入一个光滑性正则化项,其形式与先前自编码器工作中的正则化相似。
  • 在潜在空间上使用高斯分布或高斯混合模型作为先验,通过后拟合的先验用于采样,以进一步提升 FID 分数。

实验结果

研究问题

  • RQ1单射映射是否可以替代流模型中的双射映射,以降低维度和计算成本?
  • RQ2将双射性放松为单射性后,是否仍能实现高质量的样本生成和可 tractable 的训练目标?
  • RQ3概率流框架是否能自然地引出并解释正则化自编码器中使用的正则化策略?
  • RQ4在样本质量和 FID 分数方面,Injective Flow 模型与 VAE 和自编码器相比表现如何?
  • RQ5Injective Flow 是否能在保持低维潜在空间的同时,实现优于先前正则化自编码器的 FID 分数?

主要发现

  • 所提出的 Injective Flow 模型在 CIFAR-10 和 CelebA 上实现了最先进 FID 分数,优于 VAE 和标准自编码器。
  • 在 MNIST 上,模型与 β-VAE 表现相当,尽管 β-VAE 的 FID 分数略优。
  • InjFlow ℓn 使用了自适应、数据相关的 λ(温度衰减),其 FID 分数优于固定 λ=1 的 InjFlow,表明自适应正则化的关键作用。
  • 可视化结果表明,InjFlow 生成的样本更清晰,保留了更多细节(如发丝),而 VAE 生成的样本通常更模糊。
  • InjFlow 的重构结果保留了比 VAE 和标准自编码器更精细的细节,与更高的 FID 分数一致。
  • 当使用后拟合的高斯混合模型(GMM)先验而非单一高斯先验时,FID 分数进一步提升,表明先验表达能力的增强可显著提升样本质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。