Skip to main content
QUICK REVIEW

[论文解读] On the Convergence of Stochastic Variational Inference in Bayesian Networks

Ulrich Paquet|arXiv (Cornell University)|Jul 16, 2015
Gaussian Processes and Bayesian Inference参考文献 6被引用 8
一句话总结

本文研究了贝叶斯网络中随机变分推断(SVI)的收敛性问题,表明标准步长调度可能导致发散,原因在于噪声较大的非自然梯度估计。研究证明,在通过分量更新近似全局参数时,使用较小的初始步长对于稳定收敛至关重要,尤其是在贝叶斯矩阵分解等双线性模型中。

ABSTRACT

We highlight a pitfall when applying stochastic variational inference to general Bayesian networks. For global random variables approximated by an exponential family distribution, natural gradient steps, commonly starting from a unit length step size, are averaged to convergence. This useful insight into the scaling of initial step sizes is lost when the approximation factorizes across a general Bayesian network, and care must be taken to ensure practical convergence. We experimentally investigate how much of the baby (well-scaled steps) is thrown out with the bath water (exact gradients).

研究动机与目标

  • 识别并分析在一般贝叶斯网络中应用变分推断时出现的收敛失败问题,这些网络采用因子化变分近似。
  • 强调当全局参数在网络因子间分解时,自然梯度缩放优势的丧失,导致优化不稳定。
  • 研究噪声梯度估计和步长选择对推荐系统等大规模模型中实际收敛性的影响。
  • 评估使用小初始步长是否能恢复良好缩放更新的稳定性,即使舍弃了精确梯度信息。
  • 为在现实世界贝叶斯网络中部署SVI提供实证指导,特别是在矩阵分解等高维场景中。

提出的方法

  • 提出一种随机变分推断算法(算法1),利用噪声较大的分量式自然梯度估计来更新贝叶斯网络中的变分参数。
  • 采用一种随机逼近方案,其中每个变分参数的更新基于网络中随机选取的一组子节点(C),以降低计算成本。
  • 使用随时间变化的步长调度 ρt,满足 ρt → 0,∑ρt = ∞,且 ∑ρt² < ∞,以确保在随机逼近条件下的收敛性。
  • 引入两种更新方式:(a) 对各因子的参数均值进行周期性平均,以及 (b) 采用Hoffman等人提出的标准SVI更新,两者均应用于自然参数。
  • 推导出在双线性模型中高斯变分近似下的随机自然梯度更新,显式考虑了共父母和充分统计量。
  • 将该方法应用于Netflix数据集上的贝叶斯矩阵分解,采用因子化高斯近似,并对观测评分进行期望的随机估计。

实验结果

研究问题

  • RQ1为何标准随机变分推断在一般贝叶斯网络中会收敛失败,尽管在共轭指数族中表现良好?
  • RQ2当变分参数在网络组件间分解时,自然梯度缩放的丧失如何影响收敛性?
  • RQ3在SVI中使用单位长度步长时,梯度估计的方差在导致发散中起什么作用?
  • RQ4在一般贝叶斯网络中,小初始步长是否能恢复SVI的收敛稳定性?其与收敛速度之间的权衡是什么?
  • RQ5精确梯度的使用在可靠推断中有多必要?还是说通过良好缩放的噪声梯度也能实现稳定结果?

主要发现

  • 使用单位长度步长(ρt = 1)的标准SVI在一般贝叶斯网络中导致数值发散,原因在于高方差的梯度估计。
  • 当C(每次更新使用的子节点数)较小时,算法1中的两种更新方式(a)和(b)在ρt ∈ (0,1]时均发散,尤其是在矩阵分解等双线性模型中。
  • 通过使用足够小的初始步长可恢复收敛性:对于方式(a)为ρ₁ = 1/512,对于方式(b)为ρ₁ = 1/64,当C = 1时。
  • 全局随机梯度并非自然形式,这会放大不稳定性并导致过度校正,即使步长逐渐减小。
  • 实证结果表明,全变分贝叶斯(ρt = 1)隐式使用了稳定步长,但这种特性在无仔细缩放的情况下无法直接推广到随机设置。
  • 研究结论认为,尽管小步长可缓解发散,但其代价可能是舍弃了有用的梯度信息,因此最优步长选择问题仍待解决。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。