[论文解读] Speeding Up MCMC by Efficient Data Subsampling
本文提出子采样MCMC,这是一种可扩展的贝叶斯推断框架,通过控制变量从数据的小型随机子集高效估计对数似然,从而实现快速且准确的MCMC采样。通过结合偏差校正的似然估计与相关伪边缘方法,该方法仅使用m = O(√n)个样本即可实现近乎精确的后验近似,显著降低计算成本,同时保持高采样效率和可忽略的误差。
We propose Subsampling MCMC, a Markov Chain Monte Carlo (MCMC) framework where the likelihood function for $n$ observations is estimated from a random subset of $m$ observations. We introduce a highly efficient unbiased estimator of the log-likelihood based on control variates, such that the computing cost is much smaller than that of the full log-likelihood in standard MCMC. The likelihood estimate is bias-corrected and used in two dependent pseudo-marginal algorithms to sample from a perturbed posterior, for which we derive the asymptotic error with respect to $n$ and $m$, respectively. We propose a practical estimator of the error and show that the error is negligible even for a very small $m$ in our applications. We demonstrate that Subsampling MCMC is substantially more efficient than standard MCMC in terms of sampling efficiency for a given computational budget, and that it outperforms other subsampling methods for MCMC proposed in the literature.
研究动机与目标
- 解决大规模贝叶斯推断中因完整数据似然评估成本高昂而导致的MCMC计算瓶颈。
- 开发一种可扩展的MCMC框架,可在每次迭代中对数据进行子采样,同时不损失后验准确性。
- 通过控制变量降低伪边缘MCMC中似然估计器的方差,从而实现更快的混合速度和更高的接受率。
- 确保由子采样引起的扰动后验分布即使在子样本量较小时也与真实后验分布保持接近。
- 在计算效率和准确性方面,证明该方法优于现有子采样MCMC方法。
提出的方法
- 通过使用m个观测值的随机子集(其中m ≪ n)来估计对数似然,以降低计算成本。
- 应用两类控制变量:参数扩展型(围绕最大似然估计)和数据扩展型(围绕数据中心点),以降低对数似然估计器的方差。
- 通过将控制变量与基于小样本子集的残差项结合,构建对数似然的无偏估计器。
- 通过偏差校正步骤,确保估计的对数似然近似无偏于完整数据对数似然。
- 采用基于块提议和共享随机数的相关伪边缘方案,以提高梅特罗波利斯-黑斯廷斯算法的接受率。
- 采用两阶段策略:初始阶段使用较大的m值进行探索,随后在获得良好的MLE估计后减小m值以提高效率。
实验结果
研究问题
- RQ1我们能否仅使用数据的一小部分,在保持计算效率的同时,实现MCMC中近乎精确的后验近似?
- RQ2控制变量如何降低子采样子MCMC中似然估计器的方差,其对混合速度和接受率的影响如何?
- RQ3由子采样引起的扰动后验的理论误差界是什么?其随n和m的变化趋势如何?
- RQ4后验中的比例误差与似然估计器的误差相比如何,特别是在后验集中度较高的区域?
- RQ5在固定计算预算下,该方法是否能在采样效率和准确性方面优于现有子采样子MCMC方法?
主要发现
- 当使用完整数据MLE作为控制变量时,扰动后验与真实后验之间的总变差距离为O(n⁻²);当使用大小为O(√n)的子集时,该距离为O(n⁻¹/²)。
- 扰动后验的绝对比例误差极小:例如,在Bankruptcy数据集上为1.418 × 10⁻⁶(均值),在HIGGS上为8.594 × 10⁻⁸,在Covtype上为5.136 × 10⁻⁸。
- 与标准MCMC相比,该方法实现了显著的速度提升,大型数据集中的相对计算时间(RCT)降低了几个数量级。
- 在后验集中度较高的区域,误差显著更小,表明该方法在后验推断最关键的区域表现最佳。
- 在训练阶段后切换到参数扩展型控制变量,可将m从初始较大值降低至m = 1,000,从而在不损失准确性的前提下提高效率。
- 在多个真实世界数据集上的验证表明,该方法在计算效率和后验准确性方面均优于其他子采样子MCMC方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。