Skip to main content
QUICK REVIEW

[论文解读] Manifold lifting: scaling MCMC to the vanishing noise regime

Khai Xiang Au, Matthew M. Graham|arXiv (Cornell University)|Mar 9, 2020
Markov Chains and Monte Carlo Methods参考文献 33被引用 5
一句话总结

本文提出流形提升方法,将马尔可夫链蒙特卡洛(MCMC)采样扩展至消失噪声情形,此时后验分布集中于低维流形。通过将后验分布提升至更高维的流形嵌入分布,该方法实现了高效的约束哈密顿蒙特卡洛采样,即使在噪声减小至极限时仍保持高采样效率,优于标准MCMC在高维、非可识别或不适定反问题中的表现。

ABSTRACT

Standard Markov chain Monte Carlo methods struggle to explore distributions that are concentrated in the neighbourhood of low-dimensional structures. These pathologies naturally occur in a number of situations. For example, they are common to Bayesian inverse problem modelling and Bayesian neural networks, when observational data are highly informative, or when a subset of the statistical parameters of interest are non-identifiable. In this paper, we propose a strategy that transforms the original sampling problem into the task of exploring a distribution supported on a manifold embedded in a higher dimensional space; in contrast to the original posterior this lifted distribution remains diffuse in the vanishing noise limit. We employ a constrained Hamiltonian Monte Carlo method which exploits the manifold geometry of this lifted distribution, to perform efficient approximate inference. We demonstrate in several numerical experiments that, contrarily to competing approaches, the sampling efficiency of our proposed methodology does not degenerate as the target distribution to be explored concentrates near low dimensional structures.

研究动机与目标

  • 解决在高信噪比或模型不可识别时,后验分布集中在低维流形上导致的高维贝叶斯推断中MCMC采样效率下降的问题。
  • 克服标准MCMC方法在观测噪声趋近于零时的病态行为,此时后验集中导致混合不良和有效样本量低。
  • 开发一种可扩展的、几何感知的采样策略,在后验在无噪声极限下坍缩为流形时仍能保持采样效率。
  • 在不适定反问题和不可识别模型中实现稳健的近似贝叶斯推断,尤其适用于 $ d_{\mathcal{Y}} \ll d_{\Theta} $ 或结构不可识别的情形。
  • 在真实世界的反问题中,展示在提升流形上使用约束HMC优于使用对角或全息度量的标准HMC。

提出的方法

  • 将原始后验分布 $ \Theta \subset \mathbb{R}^{d_{\Theta}} $ 转换为定义在更高维空间 $ \mathbb{R}^{d_{\Theta} + d_{\mathcal{Y}}} $ 中的流形嵌入分布,保持 $ \sigma \to 0 $ 极限下的扩散结构。
  • 将提升后的目标密度定义为与 $ \exp\left( -\Phi_{\boldsymbol{\theta}}(\boldsymbol{\theta}) - \frac{1}{2\sigma^2} \| \boldsymbol{y} - F(\boldsymbol{\theta}) \|^2 \right) $ 成正比,通过约束确保在无噪声极限下 $ \boldsymbol{y} = F(\boldsymbol{\theta}) $。
  • 应用约束哈密顿蒙特卡洛(c-HMC)在提升流形上实现高效采样,使用基于投影的积分器(如牛顿投影)在动力学过程中保持约束。
  • 利用提升流形的几何特性,实现更大的积分步长和更高的接受率,尽管每步计算成本更高,但每样本所需步数更少。
  • 通过自适应调整步长和度量以优化采样效率,尤其在高维、非高斯后验中标准HMC表现不佳时。
  • 集成算法微分与数值求解器(如牛顿法),在模拟过程中计算梯度并将轨迹投影回约束流形。

实验结果

研究问题

  • RQ1在后验集中在低维流形的消失噪声情形下,能否保持MCMC采样效率?
  • RQ2将后验提升至带约束的高维流形是否能实现比标准MCMC在不可识别或不适定反问题中更高效的采样?
  • RQ3在单位计算时间内,提升流形上的约束HMC与使用对角或全息度量的标准HMC相比,有效样本量如何?
  • RQ4在 $ d_{\Theta} $ 和 $ d_{\mathcal{Y}} $ 均较大的高维情形下,所提方法的计算成本如何随维度扩展?
  • RQ5该流形提升框架能否扩展至加性高斯噪声以外的一般观测模型?

主要发现

  • 在所有测试的真实数据案例中,包括Lotka-Volterra、土壤碳和Hodgkin-Huxley模型,提升后后验上的约束HMC在每秒有效样本数上显著优于使用对角度量的标准HMC。
  • 在 $ d_{\Theta} = 7 $、$ d_{\mathcal{Y}} = 136 $ 的Hodgkin-Huxley(K)模型中,约束HMC实现每秒52个有效样本,优于使用对角度量(23)和全息度量(29)的标准HMC。
  • 在土壤碳(AK-T25)模型中,约束HMC实现每秒17个有效样本,而标准HMC使用对角度量和全息度量分别仅实现4.4和2.8个有效样本。
  • 在Lotka-Volterra模型中,后验近似为高斯分布,此时使用全息度量的标准HMC优于约束HMC,证实该方法在非高斯、不可识别情形下表现更优。
  • 由于自适应调优,约束HMC算法保持了高接受率和大步长,抵消了其更高的单步成本,从而在非高斯情形下实现更低的每样本总体计算成本。
  • 该方法在 $ d_{\mathcal{Y}} \ll d_{\Theta} $ 的问题中表现出鲁棒性,如PDE约束的反问题,其中标准MCMC在 $ \sigma \to 0 $ 时无法有效混合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。