Skip to main content
QUICK REVIEW

[论文解读] Measuring the reliability of MCMC inference with bidirectional Monte Carlo

Roger Grosse, Siddharth Ancha|arXiv (Cornell University)|Jun 7, 2016
Markov Chains and Monte Carlo Methods参考文献 2被引用 6
一句话总结

本文提出了BREAD,一种使用双向马尔可夫链蒙特卡洛方法来界定近似MCMC样本与真实后验分布之间对称KL散度(即Jeffreys散度)的协议,从而实现对WebPPL和Stan等概率编程语言中MCMC推断的可靠验证。实验表明,模型表示方式的选择——如潜变量的合并——会显著影响收敛速度,BREAD揭示出在WebPPL中合并模型收敛更快,但在Stan中则不然,同时发现WebPPL中多变量正态分布采样存在一个关键错误。

ABSTRACT

Markov chain Monte Carlo (MCMC) is one of the main workhorses of probabilistic inference, but it is notoriously hard to measure the quality of approximate posterior samples. This challenge is particularly salient in black box inference methods, which can hide details and obscure inference failures. In this work, we extend the recently introduced bidirectional Monte Carlo technique to evaluate MCMC-based posterior inference algorithms. By running annealed importance sampling (AIS) chains both from prior to posterior and vice versa on simulated data, we upper bound in expectation the symmetrized KL divergence between the true posterior distribution and the distribution of approximate samples. We present Bounding Divergences with REverse Annealing (BREAD), a protocol for validating the relevance of simulated data experiments to real datasets, and integrate it into two probabilistic programming languages: WebPPL and Stan. As an example of how BREAD can be used to guide the design of inference algorithms, we apply it to study the effectiveness of different model representations in both WebPPL and Stan.

研究动机与目标

  • 为解决黑箱概率编程系统中基于MCMC的后验推断准确性缺乏可靠、定量度量的问题。
  • 开发一种通用、自动且严谨的方法来监控推断质量,而无需专家对收敛诊断进行解释。
  • 验证在模拟数据上的推断性能是否真实反映了在真实世界数据上的表现,确保基准测试实验的相关性。
  • 通过在不同模型形式之间定量比较收敛行为,指导概率编程中的模型表示选择。
  • 通过验证前向与反向AIS链之间的理论一致性,检测概率编程系统中的实现错误。

提出的方法

  • 将双向马尔可夫链蒙特卡洛(BDMC)方法扩展,以估计对称KL散度(即Jeffreys散度)在近似后验样本与真实后验之间上界的期望值。
  • 将该方法应用于可视为在扩展状态空间上进行重要性采样的一类MCMC推断算法,如退火重要性采样(AIS)和序贯蒙特卡洛(SMC)。
  • 从精确后验样本出发构建反向AIS链,以计算散度的上界,而正向链则提供随机下界。
  • 提出BREAD(基于反向退火的散度界定),该协议在真实数据上推断超参数,从这些参数中生成模拟数据,并在模拟数据上评估推断质量,以验证其与真实数据的相关性。
  • 将BREAD集成到WebPPL和Stan中,实现在这些概率编程框架内自动、端到端的推断质量验证。
  • 利用真实数据与模拟数据之间推断行为的一致性作为诊断工具,检测实现错误,例如反向链中后验采样不正确。

实验结果

研究问题

  • RQ1如何获得一种可靠、定量的MCMC后验推断准确性度量,且独立于启发式收敛诊断?
  • RQ2MCMC推断在模拟数据上的表现在多大程度上反映了其在真实世界数据上的表现?如何验证这一点?
  • RQ3不同的模型表示方式——如潜变量的合并与未合并结构——在概率编程语言中如何影响MCMC推断的收敛速度与效率?
  • RQ4双向马尔可夫链蒙特卡洛的理论保证能否用于检测概率编程系统中的细微实现错误?
  • RQ5在选择不同模型参数化时,关于计算效率与收敛速度之间的权衡,可以得到哪些洞见?

主要发现

  • BREAD成功检测到WebPPL中多变量正态分布采样例程存在一个关键错误:反向AIS链产生的对数似然估计值低于正向链,违反了理论保证,表明后验样本不正确。
  • 在Stan中,合并的矩阵分解模型在MCMC步数上收敛更快,但未合并模型在运行时间上更高效,因为合并版本每步计算成本更高。
  • 在WebPPL中,合并的矩阵分解模型在运行时间上显著更快,尽管每步成本相似,因此在该语言中是更优的表示方式。
  • 在小型玩具示例中,BDMC对Jeffreys散度的上界估计极为准确,此时真实散度与上界均可精确计算,验证了该方法的可靠性。
  • 该协议表明,模拟数据上的推断行为与真实数据一致,支持使用模拟基准测试来指导推断配置与模型设计。
  • BREAD揭示出模型表示选择具有语言特异性影响:在WebPPL中合并变量可提升性能,但在Stan中则不然,凸显了语言感知型模型工程的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。