Skip to main content
QUICK REVIEW

[论文解读] Overdispersed Black-Box Variational Inference

Francisco J. R. Ruiz, Michalis K. Titsias|arXiv (Cornell University)|Mar 3, 2016
Gaussian Processes and Bayesian Inference参考文献 40被引用 16
一句话总结

本文提出了一种过度离散的黑箱变分推断(o-BBVI),通过在与变分近似同指数族的过度离散分布中进行重要性采样,降低了黑箱变分推断中的梯度方差。该方法即使仅使用一半的采样数量,其梯度方差也低于标准BBVI,从而在随机优化中实现更快收敛。

ABSTRACT

We introduce overdispersed black-box variational inference, a method to reduce the variance of the Monte Carlo estimator of the gradient in black-box variational inference. Instead of taking samples from the variational distribution, we use importance sampling to take samples from an overdispersed distribution in the same exponential family as the variational approximation. Our approach is general since it can be readily applied to any exponential family distribution, which is the typical choice for the variational approximation. We run experiments on two non-conjugate probabilistic models to show that our method effectively reduces the variance, and the overhead introduced by the computation of the proposal parameters and the importance weights is negligible. We find that our overdispersed importance sampling scheme provides lower variance than black-box variational inference, even when the latter uses twice the number of samples. This results in faster convergence of the black-box inference procedure.

研究动机与目标

  • 解决黑箱变分推断(BBVI)中蒙特卡罗梯度估计器方差过高的问题,该问题会减缓优化收敛速度。
  • 开发一种通用方法,适用于任意指数族变分分布,避免依赖重参数化或模型特定假设。
  • 通过构建比变分分布具有更重尾部的提议分布来更好地捕捉后验分布,从而提高BBVI的效率。
  • 证明该方法在实现显著方差降低的同时,计算开销几乎不变,使其适用于复杂模型。
  • 提供一个统一框架,增强BBVI的性能,同时保持与均场推断和结构化推断的兼容性,以及与概率编程的兼容性。

提出的方法

  • 使用重要性采样来估计BBVI中的梯度,从与变分分布同指数族的过度离散分布中抽取样本。
  • 通过调整指数族分布的离散参数τ来构建提议分布:对于参数为λ的分布,提议使用λ/τ和按1/τ缩放的形状参数。
  • 对于伽马分布,其过度离散版本的形状为(s + τ - 1)/τ,速率参数为r/τ;对于泊松分布,则变为Poisson(λ^{1/τ})。
  • 通过原始变分密度与过度离散提议密度的比值计算重要性权重。
  • 该方法为完全黑箱:仅需访问log-joint p(x,z)、log-变分q(z;λ),以及得分函数∇λ log q(z;λ)。
  • 该方法与现有方差减少技术(如控制变量和Rao-Blackwellization)兼容,可与之结合使用。

实验结果

研究问题

  • RQ1与标准BBVI相比,过度离散重要性采样是否能更有效地降低黑箱变分推断中梯度估计器的方差?
  • RQ2所提出的方法在实现显著方差降低的同时,是否保持了较低的计算开销?
  • RQ3与使用双倍采样数量的BBVI相比,o-BBVI在收敛速度和估计精度方面表现如何?
  • RQ4o-BBVI是否能普遍适用于各类指数族分布,包括那些重参数化或数值积分不可行的分布?
  • RQ5与单一过度离散提议分布相比,使用混合提议分布是否能进一步提升稳定性和性能?

主要发现

  • o-BBVI显著降低了梯度估计器的方差,即使BBVI使用双倍的蒙特卡罗采样数量,其方差仍高于o-BBVI。
  • 在非共轭时间序列模型(gn-ts)中,o-BBVI的平均样本方差低于BBVI使用双倍采样数量的情况,如图1a所示。
  • 在ELBO和预测性能(保留数据的似然)方面,o-BBVI在gn-ts模型上优于标准BBVI,如图1b和1c所示。
  • 对于基于泊松分布的深度指数族(DEF)模型,o-BBVI再次表现出更低的方差,以及更优的ELBO和困惑度性能,且两分量混合提议分布相比单一提议分布提供了略优的稳定性。
  • 尽管局部期望方法使用高斯变量的数值积分,o-BBVI在优化初期的收敛速度仍快于后者,表明其具有更高的计算效率。
  • 该方法比局部期望更通用,后者在形状参数小于1时对伽马和泊松分布失效,原因在于零点处存在奇点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。