[论文解读] Stochastic Gradient Hamiltonian Monte Carlo with Variance Reduction for Bayesian Inference
本文提出了一种方差减少的随机梯度哈密顿蒙特卡洛(SGHMC)算法——SVRG-HMC、SAGA-HMC,以及它们的二阶对称分裂变体(SVRG2nd-HMC、SAGA2nd-HMC),以提升大规模设置下的贝叶斯推断性能。通过将优化领域的方差减少技术与HMC的动量和阻尼项相结合,该方法在收敛速度和理论保证方面均优于方差减少的SGLD,实证结果表明其在使用贝叶斯神经网络的回归与分类任务中表现更优。
Gradient-based Monte Carlo sampling algorithms, like Langevin dynamics and Hamiltonian Monte Carlo, are important methods for Bayesian inference. In large-scale settings, full-gradients are not affordable and thus stochastic gradients evaluated on mini-batches are used as a replacement. In order to reduce the high variance of noisy stochastic gradients, Dubey et al. [2016] applied the standard variance reduction technique on stochastic gradient Langevin dynamics and obtained both theoretical and experimental improvements. In this paper, we apply the variance reduction tricks on Hamiltonian Monte Carlo and achieve better theoretical convergence results compared with the variance-reduced Langevin dynamics. Moreover, we apply the symmetric splitting scheme in our variance-reduced Hamiltonian Monte Carlo algorithms to further improve the theoretical results. The experimental results are also consistent with the theoretical results. As our experiment shows, variance-reduced Hamiltonian Monte Carlo demonstrates better performance than variance-reduced Langevin dynamics in Bayesian regression and classification tasks on real-world datasets.
研究动机与目标
- 为解决大规模贝叶斯推断中随机梯度的高方差问题,采用哈密顿蒙特卡洛方法。
- 将原本应用于SGLD的方差减少技术扩展至SGHMC,利用HMC的动量和阻尼项以提升收敛性能。
- 通过对称分裂方法构造二阶积分器,进一步改善收敛特性与步长稳定性。
- 在真实世界回归与分类数据集上实证验证所提算法,证明其优于基线SGHMC与方差减少的SGLD。
- 为方差减少的HMC相比方差减少的SGLD具有更优收敛性提供理论依据。
提出的方法
- 通过在小批量上维护全梯度的运行平均值,将SVRG与SAGA的方差减少技术适配至SGHMC。
- 提出SVRG-HMC与SAGA-HMC作为SGHMC的方差减少变体,在非独立同分布采样下具备理论收敛保证。
- 应用对称分裂格式将一阶积分器转换为二阶积分器,提升稳定性并降低对步长的依赖性。
- 推导收敛速率的理论界,表明其在步长与方差减少方面相比SGLD变体具有更优依赖性。
- 在HMC动力学中保留并增强动量项与阻尼项,通过方差减少与对称分裂实现。
- 在TensorFlow中实现算法,并在UCI数据集上进行评估,包括使用ReLU激活函数与高斯先验的贝叶斯神经网络。
实验结果
研究问题
- RQ1在涉及动量与阻尼项的复杂动力学背景下,能否成功将优化领域的方差减少技术扩展至SGHMC?
- RQ2当应用方差减少时,HMC中动量与阻尼项的引入是否使其理论收敛性优于SGLD?
- RQ3与标准积分器相比,对称分裂格式是否能进一步提升方差减少HMC的收敛性与稳定性?
- RQ4在收敛速度与预测性能方面,方差减少的HMC算法与原始SGHMC及方差减少的SGLD相比表现如何?
- RQ5方差减少HMC相比SGLD的性能提升是否仅源于HMC的固有优势,还是被方差减少机制进一步放大?
主要发现
- SVRG2nd-HMC与SAGA2nd-HMC在真实世界UCI数据集的回归与分类任务中,均优于原始SGHMC与SVRG/SAGA-LD。
- 所提方差减少HMC方法的收敛速度显著快于基线模型,且在多个数据集与模型架构中性能差距保持一致。
- SVRG2nd-HMC可在不发散的前提下使用稍大的步长,表明其相比SVRG-HMC具有更高的数值稳定性。
- 理论分析证实,由于动量与阻尼项的存在,方差减少的HMC相比方差减少的SGLD具有更优的收敛速率。
- SAGA2nd-HMC与SVRG2nd-HMC表现相近,但SVRG2nd-HMC因内存消耗更低且实现更简单而更受青睐。
- 实验表明,方差减少显著提升了SGHMC的收敛性能,证实其优势并非仅源于HMC相比SGLD的固有优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。