Skip to main content
QUICK REVIEW

[论文解读] Extended Stochastic Gradient MCMC for Large-Scale Bayesian Variable Selection

Qifan Song, Yan Sun|arXiv (Cornell University)|Feb 7, 2020
Markov Chains and Monte Carlo Methods参考文献 7被引用 4
一句话总结

本文提出了一种扩展的随机梯度朗之万动力学(SGLD)算法,通过引入隐变量,实现了在高维、大规模设置下具有维度跳跃模型和缺失数据的可扩展贝叶斯变量选择。通过利用小批量子采样和隐变量增强,该方法在每次迭代中固定数据使用量且无需参数分布下界,实现了高效且一致的后验推断,显著优于传统MCMC方法及现有可扩展替代方案,在可扩展性和实用性方面表现更优。

ABSTRACT

Stochastic gradient Markov chain Monte Carlo (MCMC) algorithms have received much attention in Bayesian computing for big data problems, but they are only applicable to a small class of problems for which the parameter space has a fixed dimension and the log-posterior density is differentiable with respect to the parameters. This paper proposes an extended stochastic gradient MCMC lgoriathm which, by introducing appropriate latent variables, can be applied to more general large-scale Bayesian computing problems, such as those involving dimension jumping and missing data. Numerical studies show that the proposed algorithm is highly scalable and much more efficient than traditional MCMC algorithms. The proposed algorithms have much alleviated the pain of Bayesian methods in big data computing.

研究动机与目标

  • 解决现有随机梯度MCMC方法的局限性,这些方法仅适用于固定维数、可微后验问题。
  • 在参数维度随迭代变化的变量选择和缺失数据场景下,实现大规模设置中的可扩展贝叶斯推断。
  • 开发一种方法,在每次迭代中保持固定的样本量,避免可变的数据消耗和下界要求,从而维持计算效率。
  • 在高维和大样本条件下实现一致的后验估计,确保收敛至真实后验分布。

提出的方法

  • 引入隐变量(如变量选择中的模型指标或缺失数据值),重新参数化后验分布,从而在变化维度的空间中实现基于梯度的采样。
  • 推导出给定隐变量时后验对数密度关于参数的梯度的一般恒等式,从而支持随机梯度更新。
  • 通过使用数据的小批量估计梯度,对随机梯度朗之万动力学(SGLD)进行改进,确保每次迭代的计算成本固定。
  • 利用中值定理和集中不等式,界定全数据与小批量后验概率之间的差异,证明渐近一致性。
  • 应用大数定律和中心极限定理于后验模型概率的经验平均,证明在正则性条件下收敛至真实后验。
  • 采用两级采样方案:内层循环用于在给定参数下采样模型指标,外层循环通过小批量梯度使用SGLD进行参数更新。

实验结果

研究问题

  • RQ1随机梯度MCMC能否扩展至参数数量在迭代中变化的高维贝叶斯变量选择问题?
  • RQ2在后验维度变化且数据量庞大的情况下,可扩展MCMC算法如何保持一致性和效率?
  • RQ3在维度跳跃模型中,什么条件可确保基于小批量的后验估计收敛至真实后验?
  • RQ4所提方法能否避免对参数分布下界的要求,而这类要求在实际中往往不可行?
  • RQ5在收敛性和计算成本方面,该算法与传统MCMC及其他可扩展替代方案相比表现如何?

主要发现

  • 所提出的扩展SGLD算法实现了后验模型概率的一致估计,其经验平均随迭代次数 $ T $ 和样本量 $ N $ 增大而收敛至真实后验。
  • 对于任意模型 $ S $,小批量与全数据后验概率之间的差异被限制在 $ \exp(-N\delta/2) + 1/|\mathcal{S}|^{\nu} $ 以内,当 $ p \prec n \leq N $ 时该界趋于零。
  • 该方法确保每次迭代的数据消耗固定,不同于小批量Metropolis-Hastings算法中可变的数据使用量,显著提升了可扩展性。
  • 该算法无需对参数分布施加下界,克服了精确小批量Metropolis-Hastings方法的关键局限。
  • 数值实验表明,该方法具有高度可扩展性,且在高维变量选择场景下显著优于传统MCMC,效率更高。
  • 经验模型概率估计器的收敛速度为 $ O_p(T^{-1/2}) + \exp(-N\delta/2) + O_p(m^{-1/2}) $,当 $ T, N \to \infty $ 时趋于零,确保渐近无偏性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。