Skip to main content
QUICK REVIEW

[论文解读] Local Expectation Gradients for Doubly Stochastic Variational Inference

Michalis K. Titsias|arXiv (Cornell University)|Mar 4, 2015
Gaussian Processes and Bayesian Inference参考文献 12被引用 6
一句话总结

本文提出局部期望梯度(LEG),一种低方差的随机变分推断方法,通过解析地对每个变分参数最相关的潜在变量进行边缘化来计算梯度,从而在无需控制变量的情况下实现Rao-Blackwell化估计。该方法实现了对连续和离散潜在变量的高效、可并行优化,在稳定性和收敛性方面优于标准的对数-导数法和重参数化基线方法。

ABSTRACT

We introduce local expectation gradients which is a general purpose stochastic variational inference algorithm for constructing stochastic gradients through sampling from the variational distribution. This algorithm divides the problem of estimating the stochastic gradients over multiple variational parameters into smaller sub-tasks so that each sub-task exploits intelligently the information coming from the most relevant part of the variational distribution. This is achieved by performing an exact expectation over the single random variable that mostly correlates with the variational parameter of interest resulting in a Rao-Blackwellized estimate that has low variance and can work efficiently for both continuous and discrete random variables. Furthermore, the proposed algorithm has interesting similarities with Gibbs sampling but at the same time, unlike Gibbs sampling, it can be trivially parallelized.

研究动机与目标

  • 解决双重随机变分推断中高方差的随机梯度问题,特别是针对具有离散潜在变量的非共轭模型。
  • 消除对复杂控制变量的依赖,这些控制变量在基于对数-导数的方法中难以构造且依赖于具体模型。
  • 开发一种通用的、低方差的梯度估计技术,适用于连续和离散潜在变量。
  • 通过利用因子化变分分布中的局部条件独立性,实现高效、可并行化的优化。
  • 在具有混合离散-连续结构的模型(如逻辑斯蒂信念网络)中,提升收敛稳定性和性能。

提出的方法

  • 该方法将变分参数上的梯度估计分解为多个子任务,每个子任务专注于与目标参数最相关的单一潜在变量。
  • 对于每个变分参数 $\mathbf{v}_k$,其通过精确计算与之关联的潜在变量 $x_k$ 的期望,同时对其他变量进行采样。
  • 这导致了显著降低方差的Rao-Blackwell化梯度估计,相比标准的对数-导数估计器具有优势。
  • 该方法适用于连续和离散潜在变量,避免了重参数化或控制变量的需要。
  • 该算法在结构上类似于吉布斯采样,但支持简单的并行化,而吉布斯采样本质上是顺序的。
  • 每个 $\mathbf{v}_k$ 的梯度通过一个闭式表达式计算,涉及S形变分分布和模型似然,如公式 (19) 所示。

实验结果

研究问题

  • RQ1我们能否在不依赖控制变量的情况下,为变分推断构造低方差的随机梯度?
  • RQ2我们能否通过利用因子化变分分布中的局部条件独立性来实现方差降低?
  • RQ3所提出的方法在收敛稳定性和速度方面是否优于现有的基于对数-导数和重参数化的基线方法?
  • RQ4该方法能否在保持离散和连续潜在变量低方差的同时实现高效并行化?
  • RQ5该方法在具有混合离散-连续潜在结构的复杂模型(如逻辑斯蒂信念网络)上的表现如何?

主要发现

  • 局部期望梯度方法产生的随机梯度方差低于最先进的重参数化技巧,尤其在连续空间中表现更优。
  • 与LdGrad相比,该算法收敛更快且更稳定,后者因高方差而常陷入次优局部极小值。
  • 在使用K=200个隐藏单元的二值化MNIST数据集实验中,模型实现了高质量的重构结果和稳定的训练动态。
  • 该方法可在每个数据点的一次推理过程中,高效优化识别(变分)和生成(模型)参数。
  • 该方法在不同模型架构下均表现稳健,且无需针对问题设计的方差减少技术。
  • 该算法的结构支持简单的并行化,而吉布斯采样则不具备此特性,因此该方法可扩展至大规模模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。