Skip to main content
QUICK REVIEW

[论文解读] Undirected Graphical Models as Approximate Posteriors

Arash Vahdat, Evgeny Andriyash|arXiv (Cornell University)|Jan 11, 2019
Generative Adversarial Networks and Image Synthesis参考文献 45被引用 5
一句话总结

本文提出了一种新颖的梯度估计方法,使无向图模型(UGMs),特别是玻尔兹曼机,能够作为变分自编码器(VAEs)中的近似后验分布进行训练。通过反向传播通过马尔可夫链蒙特卡洛(MCMC)更新,该方法实现了低方差梯度,并表明基于UGM的后验分布相较于传统有向模型在离散VAEs中表现更优,在MNIST和OMNIGLOT数据集上提升了生成性能。

ABSTRACT

The representation of the approximate posterior is a critical aspect of effective variational autoencoders (VAEs). Poor choices for the approximate posterior have a detrimental impact on the generative performance of VAEs due to the mismatch with the true posterior. We extend the class of posterior models that may be learned by using undirected graphical models. We develop an efficient method to train undirected approximate posteriors by showing that the gradient of the training objective with respect to the parameters of the undirected posterior can be computed by backpropagation through Markov chain Monte Carlo updates. We apply these gradient estimators for training discrete VAEs with Boltzmann machines as approximate posteriors and demonstrate that undirected models outperform previous results obtained using directed graphical models. Our implementation is available at https://github.com/QuadrantAI/dvaess .

研究动机与目标

  • 为解决在变分自编码器(VAEs)中训练无向图模型(UGMs)作为近似后验分布时缺乏有效梯度估计方法的问题。
  • 克服在大规模VAE训练中将UGMs用作后验分布时,分区函数不可计算和采样成本高昂的挑战。
  • 通过用更灵活的UGMs(如玻尔兹曼机)替代传统的有向后验模型,提升离散VAEs的表达能力和生成质量。
  • 通过开发一种适用于随机优化的可微分MCMC梯度估计器,实现UGMs的摊销推理。

提出的方法

  • 提出一种梯度估计器,通过在UGM后验中对单步吉布斯采样进行反向传播,该采样是马尔可夫链蒙特卡洛(MCMC)过程的一部分。
  • 在MCMC更新中使用重参数化采样,即使在分区函数不可计算和UGMs中归一化项难以处理的情况下,也能实现梯度计算。
  • 将该方法应用于在离散VAEs(DVAE##)中训练受限玻尔兹曼机(RBMs)作为近似后验,实现通过反向传播的端到端训练。
  • 在每个训练步骤中仅使用单步MCMC更新,以在计算成本和梯度方差之间取得平衡,实现稳定的优化。
  • 利用UGMs(如RBMs)的条件独立性结构,实现通过吉布斯采样步骤的高效反向传播。
  • 使用重要性加权自编码器(IWAE)和结构化预测基准,在多种设置下评估该方法。

实验结果

研究问题

  • RQ1能否通过在MCMC中反向传播,有效训练无向图模型作为变分自编码器中的近似后验?
  • RQ2在离散VAEs中,使用玻尔兹曼机作为近似后验是否相比有向模型能提升生成性能?
  • RQ3单步MCMC更新是否能提供足够低方差的梯度估计器,以支持在VAE框架中训练UGM后验?
  • RQ4在基准数据集上,UGM后验在对数似然和重建质量方面与有向模型相比表现如何?
  • RQ5所提出的方法能否扩展到结构化预测任务,并在性能上保持对现有方法的优势?

主要发现

  • 在MNIST上,采用RBMs作为后验的DVAE##模型测试对数似然达到-82.97纳特,优于使用有向后验的先前方法。
  • 在OMNIGLOT上,DVAE##模型达到-98.34纳特的测试对数似然,表明其在生成性能上显著优于基线DVAE模型。
  • 该方法在标准VAEs和重要性加权VAEs(IWAE)中均实现一致改进,在MNIST和OMNIGLOT上分别获得数纳特的性能增益。
  • 实验表明,UGM后验比均场后验和自回归后验更具表达能力,能够捕捉有向模型难以建模的复杂后验结构。
  • 单步MCMC更新梯度估计器提供了足够高质量的梯度,尽管存在偏差,但方差低且收敛稳定。
  • 使用所提框架重新实现先前模型(GumBolt, DVAE#)后,其性能得到提升,表明该方法具有良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。