Skip to main content
QUICK REVIEW

[论文解读] Markovian Score Climbing: Variational Inference with KL(p||q)

Christian A. Naesseth, Fredrik Lindsten|arXiv (Cornell University)|Mar 23, 2020
Gaussian Processes and Bayesian Inference参考文献 61被引用 12
一句话总结

本文提出马尔可夫分数上升(MSC),一种新型变分推断算法,通过使用偏差趋近于零的无偏随机梯度,可靠地最小化包含式KL散度 $\mathrm{KL}(p \| q)$。通过结合MCMC采样与分数函数更新,MSC在不遭受先前方法(如重加权唤醒睡眠和神经自适应SMC)系统性偏差影响的情况下收敛至局部最优解。

ABSTRACT

Modern variational inference (VI) uses stochastic gradients to avoid intractable expectations, enabling large-scale probabilistic inference in complex models. VI posits a family of approximating distributions q and then finds the member of that family that is closest to the exact posterior p. Traditionally, VI algorithms minimize the "exclusive Kullback-Leibler (KL)" KL(q || p), often for computational convenience. Recent research, however, has also focused on the "inclusive KL" KL(p || q), which has good statistical properties that makes it more appropriate for certain inference problems. This paper develops a simple algorithm for reliably minimizing the inclusive KL using stochastic gradients with vanishing bias. This method, which we call Markovian score climbing (MSC), converges to a local optimum of the inclusive KL. It does not suffer from the systematic errors inherent in existing methods, such as Reweighted Wake-Sleep and Neural Adaptive Sequential Monte Carlo, which lead to bias in their final estimates. We illustrate convergence on a toy model and demonstrate the utility of MSC on Bayesian probit regression for classification as well as a stochastic volatility model for financial data.

研究动机与目标

  • 解决传统变分推断方法最小化排斥式KL散度 $\mathrm{KL}(q \| p)$ 所带来的后验不确定性低估问题。
  • 克服现有针对包含式KL散度 $\mathrm{KL}(p \| q)$ 的方法(如重加权唤醒睡眠和神经自适应SMC)因使用有偏梯度而产生的系统性偏差。
  • 开发一种可靠且收敛的算法,通过最小化 $\mathrm{KL}(p \| q)$ 的无偏随机梯度,实现最小计算开销。
  • 在合成模型与真实世界模型上,展示MSC在收敛性与后验近似质量方面的优越性。

提出的方法

  • 提出马尔可夫分数上升(MSC),一种基于马尔可夫链样本(其平稳分布为 $p$)估计梯度的随机优化方法。
  • 采用Robbins-Monro步长调度策略,基于分数函数 $\nabla_\lambda \log q(\mathbf{z}[k])$ 更新变分参数。
  • 允许MCMC核自适应地依赖于当前的变分近似,从而在变分推断收敛过程中逐步提升MCMC质量。
  • 利用条件重要性采样(CIS)或条件序贯蒙特卡洛(CSMC)作为MCMC核,生成用于梯度估计的样本。
  • 通过使用变分提议的分数函数,确保梯度估计无偏,避免先前方法中因重要性采样引入的偏差。
  • 将该方法整合进一个随机优化框架,可严格证明收敛至 $\mathrm{KL}(p \| q)$ 的局部最优解。

实验结果

研究问题

  • RQ1是否存在一种变分推断算法,能够使用无偏梯度并保证收敛性,从而最小化包含式KL散度 $\mathrm{KL}(p \| q)$?
  • RQ2为何现有方法(如重加权唤醒睡眠和神经自适应SMC)在目标为 $\mathrm{KL}(p \| q)$ 的情况下仍产生有偏的后验近似?
  • RQ3MSC在收敛性与边缘似然估计方面,相较于基于IS与SMC的方法表现如何?
  • RQ4在已知存在不确定性低估问题的模型中,MSC能否提供更稳健的后验近似?
  • RQ5在金融时间序列建模等真实应用场景中,MSC是否优于基于SMC的优化方法?

主要发现

  • MSC收敛至包含式KL散度 $\mathrm{KL}(p \| q)$ 的局部最优解,而有偏方法则收敛至次优解。
  • 在一个简单的偏态正态模型中,MSC避免了重加权唤醒睡眠与神经自适应SMC中观察到的系统性偏差,后者始终低估后验方差。
  • 在贝叶斯probit回归中,MSC的边缘似然估计优于基于IS的优化方法,并在基准数据集上达到或超过期望传播(EP)的性能。
  • 在18个外汇汇率数据集上,MSC的对数边缘似然显著高于基于SMC的方法[22],其中 $S=10$ 用于训练,$S=10,000$ 用于评估。
  • MSC对粒子数 $S$ 的选择具有鲁棒性,在Heart与Ionos数据集上,不同 $S$ 值下收敛至相近的均值,而IS方法在低 $S$ 时表现出强烈偏差。
  • 该方法在多个模型中表现一致,包括随机波动率模型,MSC在边缘似然估计方面优于基于SMC的优化方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。