Skip to main content
QUICK REVIEW

[论文解读] Learnable Explicit Density for Continuous Latent Space and Variational Inference

Chin-Wei Huang, Abdelaziz Touati|arXiv (Cornell University)|Oct 6, 2017
Generative Adversarial Networks and Image Synthesis参考文献 11被引用 19
一句话总结

本文通过使用可逆流(特别是逆自回归流,inverse AF)使先验和后验均变得灵活,提出了一种可学习的显式密度变分自编码器(VAE)。实验表明,学习先验可提升采样质量和推理性能,通过更好地匹配边缘近似后验分布;理论上证明了 inverse AF 是复杂后验分布的通用近似器,在 MNIST 和合成混合数据集上优于标准高斯先验。

ABSTRACT

In this paper, we study two aspects of the variational autoencoder (VAE): the prior distribution over the latent variables and its corresponding posterior. First, we decompose the learning of VAEs into layerwise density estimation, and argue that having a flexible prior is beneficial to both sample generation and inference. Second, we analyze the family of inverse autoregressive flows (inverse AF) and show that with further improvement, inverse AF could be used as universal approximation to any complicated posterior. Our analysis results in a unified approach to parameterizing a VAE, without the need to restrict ourselves to use factorial Gaussians in the latent real space.

研究动机与目标

  • 通过将先验分布设为可学习而非固定为因子分解高斯分布,以提升变分自编码器(VAE)的性能。
  • 解决由于熵估计过高和先验-后验分布不匹配导致 VAE 生成样本质量差的问题。
  • 从理论上证明使用逆自回归流(inverse AF)可作为复杂后验分布的通用近似器。
  • 通过可逆归一化流统一建模先验与后验,避免对潜在空间分布施加限制性假设。
  • 通过实证表明,灵活的先验在训练稳定性和似然性能上优于灵活的后验。

提出的方法

  • 该方法将 VAE 训练分解为逐层密度估计,将边缘近似后验视为先验的目标分布。
  • 使用可逆流——特别是 inverse AF——对先验和后验进行参数化,实现显式密度估计。
  • 先验通过具有 NVP 风格耦合层的归一化流进行学习,使其能够适应数据流形。
  • 后验通过使用 MADE 或 PixelCNN 风格自回归结构的 inverse AF 建模,实现可并行化、灵活的密度估计。
  • 通过联合训练编码器、解码器以及基于流的先验/后验,优化变分下界,最小化近似后验与真实后验之间的 KL 散度。
  • 该方法通过用可学习的灵活密度替代固定的因子分解高斯分布,避免了对潜在空间分布的限制性假设。

实验结果

研究问题

  • RQ1在 VAE 中学习先验分布是否能相比固定先验提升样本生成质量和推理性能?
  • RQ2使用逆自回归流(inverse AF)是否能实现在变分推断中对复杂后验分布的通用近似?
  • RQ3为何使用灵活先验的模型训练更稳定且似然性能更优?
  • RQ4能否通过学习一个与边缘近似后验匹配的先验来减少熵估计过高问题并改善数据分布建模?
  • RQ5在提升 VAE 似然和样本质量方面,先验灵活性与后验灵活性的相对贡献分别是什么?

主要发现

  • 在 MNIST 上,使用可学习先验的模型优于使用灵活后验的模型,先验使用 16 个 NVP 层、后验使用 16 个 MADE 层时,负对数似然(NLL)达到 80.81。
  • 使用 8 个 NVP 层作为先验、8 个 MADE 层作为后验,可将 NLL 从基线的 83.11 降低至 80.81,显著提升了似然性能。
  • 仅使用灵活先验即可将 NLL 从 90.78 降低至 88.70,表明即使不引入后验灵活性,先验学习本身也能提升性能。
  • 使用 inverse AF 作为后验近似器可实现对复杂后验的通用近似,为其在 VAE 中的应用提供了理论依据。
  • 采用可学习先验的训练能更好地匹配边缘后验分布,从而减小真实后验与变分近似之间的差异。
  • 该方法在基于归一化流的 VAE 中实现了 MNIST 上的最先进似然性能,使用 16 个 NVP 和 16 个 MADE 层时,最终 NLL 达到 80.60。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。