Skip to main content
QUICK REVIEW

[论文解读] A Tutorial on Parametric Variational Inference

Jens Sjölund|arXiv (Cornell University)|Jan 3, 2023
Genetic and phenotypic traits in livestock被引用 4
一句话总结

本教程将参数化变分推断作为贝叶斯推断中马尔可夫链蒙特卡洛(MCMC)方法的可扩展替代方案,重点介绍通过优化可处理的下界(ELBO)来近似难以处理的后验分布。内容涵盖重参数化技巧、通过神经网络实现的摊销推断,以及基于得分函数估计器的黑箱变分推断,使现代机器学习中的大规模贝叶斯建模更加高效。

ABSTRACT

Variational inference uses optimization, rather than integration, to approximate the marginal likelihood, and thereby the posterior, in a Bayesian model. Thanks to advances in computational scalability made in the last decade, variational inference is now the preferred choice for many high-dimensional models and large datasets. This tutorial introduces variational inference from the parametric perspective that dominates these recent developments, in contrast to the mean-field perspective commonly found in other introductory texts.

研究动机与目标

  • 为参数化变分推断提供系统性介绍,作为贝叶斯推断中MCMC方法的可扩展替代方案。
  • 解释证据下界(ELBO)如何实现对难以处理的后验分布的基于优化的近似。
  • 介绍现代技术如摊销变分推断和黑箱变分推断,以处理高维和大规模模型。
  • 阐明Kullback-Leibler散度在ELBO最大化与后验近似之间关系中的作用。
  • 弥合现代概率机器学习中理论基础与实际实现之间的差距。

提出的方法

  • 使用证据下界(ELBO)作为难以处理的边缘似然的可处理替代量,通过Jensen不等式和KL散度分解推导得出。
  • 利用Kullback-Leibler散度衡量真实后验与变分近似之间的差异,其最小化等价于ELBO最大化。
  • 应用重参数化技巧,实现对可微变分族的低方差梯度估计,从而支持随机梯度优化。
  • 通过神经网络(编码器)引入摊销变分推断,将观测映射到变分参数,将每个数据点的优化简化为一次模型前向传播。
  • 在黑箱变分推断中使用得分函数估计器(REINFORCE)处理不可重参数化的模型,并结合控制变量等方差减少技术。
  • 利用自动微分计算ELBO相对于变分参数的梯度,支持在复杂模型中进行端到端训练。

实验结果

研究问题

  • RQ1我们如何通过优化而非积分来近似贝叶斯模型中难以处理的后验分布?
  • RQ2ELBO在变分推断中的作用是什么?它与真实边缘似然和KL散度有何关系?
  • RQ3重参数化技巧适用于哪些场景?它如何改善变分推断中的梯度估计?
  • RQ4摊销变分推断如何在具有局部潜变量的大规模贝叶斯模型中降低计算成本?
  • RQ5黑箱变分推断存在哪些局限性?方差减少技术如何提升其实用性?

主要发现

  • ELBO为对数边缘似然提供了一个下界,该下界既可处理又适合优化,从而实现可扩展的后验近似。
  • 最大化ELBO等价于最小化变分后验与真实后验之间的KL散度,确保近似更加紧密。
  • 重参数化技巧可通过自动微分实现精确的梯度计算,从而在可微模型中获得低方差的梯度估计。
  • 摊销变分推断将每个数据点的优化简化为通过神经网络的一次前向传播,显著提升了大规模数据集的可扩展性。
  • 结合得分函数估计器的黑箱变分推断可在不可重参数化的模型中实现基于梯度的优化,尽管方差较高,但可通过控制变量等技术有效缓解。
  • 摊销与重参数化相结合,可高效训练现代模型(如变分自编码器),其中编码器与解码器通过随机梯度下降联合优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。