[论文解读] Quasi-Monte Carlo Variational Inference
本文提出准蒙特卡洛变分推断(QMCVI),用低差异的准蒙特卡洛(QMC)序列替代独立同分布(i.i.d.)的蒙特卡洛采样,以降低变分推断中随机优化的梯度方差。通过使用随机化QMC(RQMC),该方法实现了比标准SGD更快的收敛速度和渐近更优的收敛率,实证结果表明在大规模模型上实现了数量级的加速。
Many machine learning problems involve Monte Carlo gradient estimators. As a prominent example, we focus on Monte Carlo variational inference (MCVI) in this paper. The performance of MCVI crucially depends on the variance of its stochastic gradients. We propose variance reduction by means of Quasi-Monte Carlo (QMC) sampling. QMC replaces N i.i.d. samples from a uniform probability distribution by a deterministic sequence of samples of length N. This sequence covers the underlying random variable space more evenly than i.i.d. draws, reducing the variance of the gradient estimator. With our novel approach, both the score function and the reparameterization gradient estimators lead to much faster convergence. We also propose a new algorithm for Monte Carlo objectives, where we operate with a constant learning rate and increase the number of QMC samples per iteration. We prove that this way, our algorithm can converge asymptotically at a faster rate than SGD. We furthermore provide theoretical guarantees on QMC for Monte Carlo objectives that go beyond MCVI, and support our findings by several experiments on large-scale data sets from various domains.
研究动机与目标
- 降低当前依赖独立同分布采样且噪声较高的蒙特卡洛变分推断(MCVI)中随机梯度估计器的方差。
- 研究在贝叶斯推断的蒙特卡洛目标中,使用准蒙特卡洛(QMC)序列替代 i.i.d. 样本的理论与实证优势。
- 开发一种新优化算法,在迭代过程中保持恒定学习率的同时增加 QMC 样本数量,实现更快的渐近收敛。
- 为基于 QMC 的梯度估计器在 MCVI 及其扩展中的方差缩减和收敛率提供理论保证。
- 实现将 QMC 轻松集成到 STAN 和 Edward 等现有概率编程框架中,仅需极少代码修改。
提出的方法
- 在 MCVI 中,用单位超立方体 [0,1]^d 上的确定性、低差异 QMC 序列替代独立同分布的均匀随机样本,以改善覆盖范围并降低方差。
- 使用随机化 QMC(RQMC)在保持梯度估计器无偏性的同时,实现比标准蒙特卡洛更低的渐近方差。
- 提出一种新优化算法,采用恒定学习率但逐次增加每轮迭代的 RQMC 样本数量,从而实现更快收敛。
- 证明在强凸性和温和正则性假设下,基于 RQMC 的算法渐近收敛速度优于使用标准蒙特卡洛的 SGD。
- 将该方法应用于变分推断中的得分函数和重参数化梯度估计器,证明其广泛适用性。
- 通过将均匀随机数生成替换为 RQMC 序列,并应用标准重参数化技术从目标分布中采样,实现该方法的工程实现。
实验结果
研究问题
- RQ1准蒙特卡洛采样是否能比 i.i.d. 采样更有效地降低蒙特卡洛变分推断中随机梯度估计器的方差?
- RQ2使用随机化 QMC(RQMC)是否能为蒙特卡洛目标带来比标准 SGD 更快的可证明渐近收敛率?
- RQ3在使用 RQMC 样本时,采用恒定学习率但样本数量递增的优化算法是否能实现优于 SGD 的收敛性能?
- RQ4QMCVI 在复杂模型(如贝叶斯神经网络和大规模数据集)上的实际表现如何?
- RQ5QMCVI 与现有方差缩减技术(如控制变量)结合的潜力有多大?是否存在潜在权衡?
主要发现
- 在 N=10 和 N=50 样本下,QMCVI 的梯度方差显著低于标准蒙特卡洛和控制变量基线,降低了一到三个数量级。
- 在 d=653 参数的贝叶斯神经网络上,QMCVI 在 N=10 时达到比标准 MCVI 更高的 ELBO 值,且在 N=50 时更快收敛至相同 ELBO。
- 所提出的算法通过逐步增加 RQMC 样本数量并保持恒定学习率,实现了比 SGD 更快的渐近收敛率,该结论在二维正态目标分布实验中得到验证。
- 在无数据子采样噪声的情况下,QMCVI 的收敛速度优于 SGD,其与最优 ELBO 的对数差值随迭代次数减少得更快。
- 理论分析表明,RQMC 下迭代点的平稳方差相比标准蒙特卡罗降低了 N 倍,从而实现更接近最优解的收敛。
- 通过将均匀随机数生成替换为 RQMC 序列,QMCVI 可轻松集成至 STAN 和 Edward 等现有概率编程工具中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。