Skip to main content
QUICK REVIEW

[论文解读] Average of Recentered Parallel MCMC for Big Data

Changye Wu, Christian P. Robert|arXiv (Cornell University)|Jun 15, 2017
Markov Chains and Monte Carlo Methods参考文献 15被引用 5
一句话总结

本文提出了一种可扩展的贝叶斯推断方法,用于大规模数据,通过结合从划分数据中获得的重新中心化、重缩放的子后验分布的MCMC样本。通过将每个子后验的似然函数按数据划分数量进行缩放,并将其重新中心化到其均值,该方法在计算开销极低的情况下实现了高精度的后验近似,相较于现有并行MCMC方法在统计有效性与效率方面均有显著提升。

ABSTRACT

In big data context, traditional MCMC methods, such as Metropolis-Hastings algorithms and hybrid Monte Carlo, scale poorly because of their need to evaluate the likelihood over the whole data set at each iteration. In order to resurrect MCMC methods, numerous approaches belonging to two categories: divide-and-conquer and subsampling, are proposed. In this article, we study the parallel MCMC and propose a new combination method in the divide-and-conquer framework. Compared with some parallel MCMC methods, such as consensus Monte Carlo, Weierstrass Sampler, instead of sampling from subposteriors, our method runs MCMC on rescaled subposteriors, but share the same computation cost in the parallel stage. We also give the mathematical justification of our method and show its performance in several models. Besides, even though our new methods is proposed in parametric framework, it can been applied to non-parametric cases without difficulty.

研究动机与目标

  • 解决传统MCMC方法在大规模数据场景下的可扩展性限制,其中每次迭代都需要计算完整数据的似然函数,计算成本过高。
  • 在现有划分-合并MCMC方法的基础上进行改进,确保统计一致性并减少子后验组合带来的偏差。
  • 开发一种计算成本与标准并行MCMC相当的方法,但通过重新中心化和平均重缩放的子后验分布,实现更高的精度。
  • 提供一个数学上严谨的框架,该框架在参数和非参数贝叶斯模型中均适用。

提出的方法

  • 将数据集划分为K个大小相等的子集,通过将每个子集的对数似然函数乘以K,构建子后验分布,从而使其方差与完整后验分布的方差相当。
  • 在每个重缩放的子后验分布上独立运行MCMC,生成样本,得到每个子集的后验均值θ*ᵢ。
  • 通过平均各子后验均值得到全局中心化点,ȳ* = (1/K)∑θ*ᵢ。
  • 通过减去各自子后验的均值并加上全局均值,对每组MCMC样本进行重新中心化,使其围绕整体后验期望值集中。
  • 通过在所有K个子集上平均重新中心化的样本,获得对完整后验的最终近似。
  • 该方法在组合阶段避免了额外的MCMC运行,仅依赖于简单的重新中心化和平均操作,计算效率极高。

实验结果

研究问题

  • RQ1通过重新加权和重新中心化子后验分布,划分-合并MCMC方法能否在统计精度上优于共识蒙特卡洛方法?
  • RQ2将子后验按划分数量K进行重缩放,是否能使其方差与完整后验的尺度相匹配,从而提升近似质量?
  • RQ3通过简单平均重新中心化的子后验,能否在不进行额外MCMC采样的情况下,获得有效且准确的真后验近似?
  • RQ4考虑到该方法的理论依据是在参数框架下推导的,其在非参数贝叶斯模型中的表现如何?

主要发现

  • 与共识蒙特卡洛及其他并行MCMC方法相比,所提出的方法在高维和复杂模型中显著提升了后验近似精度。
  • 对重缩放子后验进行重新中心化和平均处理后,得到的后验近似与完整数据MCMC后验高度一致,仿真研究中的密度图已证明这一点。
  • 该方法在并行阶段的计算成本与标准并行MCMC相同,仅在组合阶段有可忽略的额外开销,因此在大规模数据场景下具有极高的效率。
  • 基于Bernstein-von Mises定理的理论论证表明,在似然函数和先验满足温和正则性条件下,该方法具有渐近有效性。
  • 在N=10⁶、K=50的混合模型仿真中,尽管每条MCMC链仅处理了数据的一小部分,该方法生成的后验估计在视觉和统计上均与完整MCMC结果无法区分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。