Skip to main content
QUICK REVIEW

[论文解读] Gradient-based Adaptive Markov Chain Monte Carlo

Michalis K. Titsias, Πέτρος Δελλαπόρτας|arXiv (Cornell University)|Nov 4, 2019
Markov Chains and Monte Carlo Methods被引用 10
一句话总结

本文提出了一种基于梯度的自适应MCMC框架,通过广义速度度量——一种最大熵正则化目标函数——优化提议分布,即使在提议被拒绝时也能实现稳健的自适应。通过利用重参数化技巧的随机梯度优化,该方法在采样效率上优于传统MCMC和哈密顿MCMC方法,尤其在高维和重尾目标分布上表现更优。

ABSTRACT

We introduce a gradient-based learning method to automatically adapt Markov chain Monte Carlo (MCMC) proposal distributions to intractable targets. We define a maximum entropy regularised objective function, referred to as generalised speed measure, which can be robustly optimised over the parameters of the proposal distribution by applying stochastic gradient optimisation. An advantage of our method compared to traditional adaptive MCMC methods is that the adaptation occurs even when candidate state values are rejected. This is a highly desirable property of any adaptation strategy because the adaptation starts in early iterations even if the initial proposal distribution is far from optimum. We apply the framework for learning multivariate random walk Metropolis and Metropolis-adjusted Langevin proposals with full covariance matrices, and provide empirical evidence that our method can outperform other MCMC algorithms, including Hamiltonian Monte Carlo schemes.

研究动机与目标

  • 解决传统自适应MCMC方法因忽略被拒绝状态而适应缓慢的问题,这些方法依赖于相关性较强且早期的样本。
  • 克服贪婪自适应策略的局限性,后者对初始参数选择较差的情况极为敏感。
  • 开发一种可扩展的、基于梯度的方法,仅利用目标对数密度的梯度信息,学习随机游走和朗之万提议中的完整协方差矩阵。
  • 通过最大化一个广义速度度量来提高采样效率,该度量在高接受率和提议多样性之间实现平衡。
  • 在高维和多尺度目标分布中实现更快的收敛速度和更优的混合性能,包括贝叶斯逻辑回归和多元正态分布。

提出的方法

  • 将广义速度度量定义为一个熵正则化的目标函数,以优化提议参数,促进高接受率和提议多样性。
  • 使用带重参数化技巧的随机梯度优化,反向传播通过MCMC转移核并更新提议参数。
  • 将该方法应用于带完整协方差矩阵的多元随机游走Metropolis (RWM) 和马尔可夫链-调整朗之万 (MALA) 算法,协方差矩阵通过Cholesky分解参数化。
  • 不仅利用接受状态处的目标对数密度梯度,还利用被拒绝候选点的梯度,使即使在链未移动时也能实现自适应。
  • 使用带有学习率调度的在线学习优化提议参数,实现在采样过程中持续自适应。
  • 通过Metropolis-Hastings接受机制保持细致平衡,确保遍历性和收敛性,同时在自适应提议分布。

实验结果

研究问题

  • RQ1基于梯度的自适应MCMC方法是否能比忽略被拒绝状态的传统方法实现更快、更稳健的自适应?
  • RQ2与标准自适应MCMC和HMC方法相比,广义速度度量目标如何提升采样效率?
  • RQ3在多尺度目标分布中,基于梯度的自适应方法结合完整协方差学习,与各向同性或对角提议相比,性能提升程度如何?
  • RQ4当初始提议远离目标分布时,该方法是否仍能保持稳定性和收敛性?
  • RQ5该框架能否有效扩展到高维问题,如具有87个参数的贝叶斯逻辑回归?

主要发现

  • 在100维多元正态目标上,gadMALAf变体的总体效率得分(最小ESS/s)最高,优于所有基线方法,包括20步跳跃的HMC。
  • 在Caravan数据集(87维贝叶斯逻辑回归)上,gadMALAf实现了每秒最高的有效样本量(ESS),即使NUTS的ESS较高,但因计算成本过高而表现不如gadMALAf。
  • 轨迹图显示,与标准自适应Metropolis (AM) 相比,gadMALA方法的自相关性显著降低,表明混合更快、探索更优。
  • 在gadMALAf中学习到的Cholesky因子L的对角元素在各维度上紧密匹配最优缩放(0.01至1.00),证明了对目标多尺度结构的准确适应。
  • 由于利用了被拒绝状态的梯度,该方法在早期迭代中实现了更快的自适应,即使在链停滞时也能学习。
  • 在MNIST(785维)上的补充结果证实了该框架在高维设置下的可扩展性和稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。