Skip to main content
QUICK REVIEW

[论文解读] Learning Latent Space Energy-Based Prior Model

Bo Pang, Tian Han|arXiv (Cornell University)|Jun 15, 2020
Topic Modeling参考文献 84被引用 4
一句话总结

本文提出了一种潜在空间能量基先验模型,通过在生成器网络的潜在空间中学习一个表达性强的先验,增强了生成模型。通过使用短时MCMC采样进行最大似然联合训练能量基先验与自顶向下生成器,该模型在图像和文本生成以及异常检测任务中实现了最先进性能,展现出高质量的样本生成效果和在低维潜在空间中的高效混合能力。

ABSTRACT

We propose to learn energy-based model (EBM) in the latent space of a generator model, so that the EBM serves as a prior model that stands on the top-down network of the generator model. Both the latent space EBM and the top-down network can be learned jointly by maximum likelihood, which involves short-run MCMC sampling from both the prior and posterior distributions of the latent vector. Due to the low dimensionality of the latent space and the expressiveness of the top-down network, a simple EBM in latent space can capture regularities in the data effectively, and MCMC sampling in latent space is efficient and mixes well. We show that the learned model exhibits strong performances in terms of image and text generation and anomaly detection. The one-page code can be found in supplementary materials.

研究动机与目标

  • 通过在生成器网络的潜在空间中学习一个信息丰富的先验,提升深度生成模型的表达能力。
  • 通过基于能量的建模学习数据驱动的先验,解决标准VAE中无信息先验(如各向同性高斯分布)的局限性。
  • 提出一种联合学习框架,利用MCMC采样进行最大似然估计,联合训练能量基先验与自顶向下生成器。
  • 通过利用潜在空间的低维特性,确保MCMC采样高效且具有良好混合性。
  • 提供一个理论基础坚实的训练方法,基于短时MCMC,且具备通过推理网络实现近似推理的潜力。

提出的方法

  • 将潜在先验建模为能量基模型(EBM),其负能量函数由一个小型前馈神经网络参数化:$ p_{\alpha}(z) = \frac{1}{Z(\alpha)} \exp(f_{\alpha}(z)) p_0(z) $,其中 $ p_0(z) $ 为标准高斯分布。
  • 使用自顶向下生成器网络 $ g_{\beta}(z) $ 将学习到的潜在先验映射到数据分布,其中 $ p_{\beta}(x|z) $ 根据模态类型定义为高斯分布或自回归模型。
  • 对先验和后验推理均采用短时MCMC采样:从固定初始分布出发,固定步数采样以近似 $ p(z|x) $ 和 $ p_{\alpha}(z) $。
  • 通过Langevin动力学结合噪声和梯度步长,从后验和先验分布中采样:$ z_{t+1} = z_t - \frac{1}{2} a^2 (\nabla \log p(x|z) + \nabla f_{\alpha}(z) + \frac{1}{z}) + a \epsilon $。
  • 通过基于先验与后验样本差异更新EBM参数,并通过重构损失更新生成器参数,实现联合最大似然学习。
  • 在后续工作中通过学习到的网络实现推理近似,但当前方法完全依赖于短时MCMC,未使用近似推理。

实验结果

研究问题

  • RQ1在生成器模型的潜在空间中学习能量基先验,是否能相比固定先验显著提升样本质量和建模能力?
  • RQ2在低维潜在空间中,短时MCMC采样在该框架中对先验和后验推理的有效性如何?
  • RQ3联合最大似然训练能量基先验与自顶向下生成器,是否能在图像和文本生成任务中取得更优性能?
  • RQ4该模型在多大程度上可泛化至异常检测任务?
  • RQ5短时MCMC学习的理论基础能否扩展至使用神经网络的近似推理?

主要发现

  • 该模型在图像生成任务中表现优异,SVHN数据集上的FID分数通过60步后验MCMC采样和128通道生成器提升至26.13。
  • 增加后验采样中短时MCMC步数(从20步增至60步)可使FID从29.44降至26.13,表明样本质量显著提升。
  • 更高的模型复杂度(如EBM中200个隐层单元、128通道生成器)可带来更低的FID(26.95),表明模型容量提升增强了表达能力。
  • 潜在空间EBM先验显著优于固定高斯先验,在相同设置下FID从32.25(高斯先验)降至26.95(学习到的EBM先验)。
  • 该模型在文本生成和异常检测任务中也表现出竞争力,验证了其在图像合成之外的泛化能力。
  • 理论分析表明,短时MCMC学习是MLE的合理扰动,为该方法提供了坚实的理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。