Skip to main content
QUICK REVIEW

[论文解读] JAGS, NIMBLE, Stan: a detailed comparison among Bayesian MCMC software

Mario Beraha, Daniele Falco|arXiv (Cornell University)|Jul 20, 2021
Markov Chains and Monte Carlo Methods参考文献 44被引用 10
一句话总结

本文对 JAGS、NIMBLE 和 Stan——三种主流贝叶斯 MCMC 软件平台——进行了全面的实证比较,评估其在不同类型模型、先验分布和数据生成机制下的表现。研究发现,对于非共轭模型(如逻辑回归和 AFT 模型),Stan 在效率和样本质量方面表现最优;对于共轭线性模型,JAGS 表现最佳;而对于混合模型,NIMBLE 效率最高。

ABSTRACT

The aim of this work is the comparison of the performance of the three popular software platforms JAGS, NIMBLE and Stan. These probabilistic programming languages are able to automatically generate samples from the posterior distribution of interest using MCMC algorithms, starting from the specification of a Bayesian model, i.e. the likelihood and the prior. The final goal is to present a detailed analysis of their strengths and weaknesses to statisticians or applied scientists. In this way, we wish to contribute to make them fully aware of the pros and cons of this software. We carry out a systematic comparison of the three platforms on a wide class of models, prior distributions, and data generating mechanisms. Our extensive simulation studies evaluate the quality of the MCMC chains produced, the efficiency of the software and the goodness of fit of the output. We also consider the efficiency of the parallelization made by the three platforms.

研究动机与目标

  • 系统评估 JAGS、NIMBLE 和 Stan 在广泛贝叶斯模型中的性能、收敛性和效率。
  • 识别每种软件平台在 MCMC 链质量、采样速度和并行化效率方面的优缺点。
  • 为应用统计学家和方法论研究人员在特定建模任务中选择最合适的软件提供指导。
  • 基于多种模型类别和先验分布的重复模拟,提供稳健的数据驱动基准。
  • 根据模型类型、先验结构和计算效率,提供软件选择的实际建议。

提出的方法

  • 在五类模型上开展广泛的模拟研究:线性模型(含共轭先验和套索先验)、逻辑回归、加速失效时间(AFT)模型以及有限混合模型。
  • 在所有三个平台中使用相同的模型规格和 MCMC 配置(如迭代次数、烧录期、稀释率),以确保公平比较。
  • 通过关键诊断指标评估 MCMC 表现:有效样本量(ESS)、潜在尺度降低因子(R-hat)以及采样速度(每秒样本数)。
  • 每种模型重复模拟 20 至 50 次,以确保结果稳健,并评估不同数据实现下性能的变异性。
  • 通过时间归一化的有效样本量(ess/Ns)和采样率(每秒样本数)衡量计算效率。
  • 通过比较多核环境下的性能,评估并行化效率,其中各平台均支持该功能。

实验结果

研究问题

  • RQ1对于具有正态先验的共轭线性模型,哪种软件平台能产生最高效的 MCMC 链(最高 ESS)?
  • RQ2在正态先验下,JAGS、NIMBLE 和 Stan 在逻辑回归模型中的采样速度和链自相关性方面如何比较?
  • RQ3在处理复杂模型(如具有非层次先验的加速失效时间,AFT 模型)时,三种平台的相对表现如何?
  • RQ4先验选择(如套索与共轭先验)如何影响各软件平台的相对效率和收敛性?
  • RQ5在具有潜在混合结构的模型中,NIMBLE 在哪些场景下能显著优于 JAGS 和 Stan?

主要发现

  • 对于具有共轭先验的线性模型,JAGS 和 Stan 生成高质量的 MCMC 链,有效样本量(ESS)较高,而 NIMBLE 生成的链自相关性极强。
  • 在共轭线性模型中,JAGS 的原始采样速度最快(约 900 个样本/秒),但 NIMBLE 显著更慢(约 2500 个样本/秒),且生成的链效率更低。
  • 在正态先验下的逻辑回归模型中,Stan 的 ESS 效率达到 55–90%,而 JAGS 和 NIMBLE 均低于 30%,表明 Stan 的链混合性更好,自相关性更低。
  • 在逻辑回归中,Stan 的采样速度(400 个样本/秒)优于 JAGS(35 个样本/秒)和 NIMBLE(240 个样本/秒),使其在该类模型中整体效率最高。
  • 在套索先验下的线性模型中,JAGS 速度过慢,不推荐使用;Stan 生成的链自相关性低于 NIMBLE,且速度更快,因此是首选。
  • 在有限混合模型中,NIMBLE 效率最高,采样速度约为 400 个样本/秒,显著优于 JAGS(120 个样本/秒)和 Stan(120 个样本/秒),且在速度与 ESS 质量之间达到最佳平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。