QUICK REVIEW
[论文解读] Model comparison with missing data using MCMC and importance sampling
Panayiota Touloupou, Naif Alzahrani|arXiv (Cornell University)|Dec 15, 2015
Bayesian Methods and Mixture Models参考文献 24被引用 3
一句话总结
本文提出了一种计算高效的贝叶斯模型比较中边缘似然估计方法,采用MCMC与重要性采样相结合的混合方法。通过将MCMC样本与基于后验的参数化近似的重要性采样估计器相结合,该方法在流行病学和时间序列数据上优于现有技术——包括Chib方法、幂后验和调和平均估计器,即使在可逆跳变MCMC失效的非嵌套模型中也能实现稳健的模型选择。
ABSTRACT
Selecting between competing statistical models is a challenging problem especially when the competing models are non-nested. In this paper we offer a simple solution by devising an algorithm which combines MCMC and importance sampling to obtain computationally efficient estimates of the marginal likelihood which can then be used to compare the models. The algorithm is successfully applied to longitudinal epidemic and time series data sets and shown to outperform existing methods for computing the marginal likelihood.
研究动机与目标
- 解决在模型非嵌套且可逆跳变MCMC不可行时,贝叶斯统计中模型比较的挑战。
- 开发一种计算高效且稳健的边缘似然估计方法,尤其在解析计算不可行时适用。
- 实现对具有缺失或不完整观测的复杂纵向和时间序列数据的准确贝叶斯因子估计。
- 提供一种实用且自动化的算法,集成MCMC、后验近似与重要性采样,用于边缘似然估计。
提出的方法
- 该方法使用MCMC从模型参数空间生成后验样本,并用参数密度q(θ)近似真实后验。
- 基于从q(θ)中抽取的样本,构建重要性采样估计器,权重由π(θ)/q(θ)的比值确定,以估计边缘似然π(x)。
- 关键估计量为 ˆPq = (1/N) Σ π(x|θi) π(θi)/q(θi),其中θi从q(θ)中抽取,确保对π(x)的无偏估计。
- 该方法在时间序列和纵向数据中尤为有效,利用滤波技术在解析形式不可用时计算π(x|θ)。
- 该算法可并行化,因为重要性采样评估相互独立,支持可扩展计算。
- 通过使用一致的提议分布q(θ)近似后验,即使模型在结构上不同,也避免了对可逆跳变MCMC的需求。
实验结果
研究问题
- RQ1在存在缺失数据和非嵌套模型的情况下,混合MCMC-重要性采样方法是否能比现有方法提供更准确、更高效的边缘似然估计?
- RQ2该方法在时间序列和流行病学数据上与Chib方法、幂后验和调和平均估计器相比性能如何?
- RQ3当竞争模型之间存在结构差异导致可逆跳变MCMC不可行时,该方法在多大程度上支持模型选择?
- RQ4该方法能否有效应用于具有复杂依赖结构(如季节性趋势和低计数时间序列)的真实纵向数据?
主要发现
- 在多个流行病学和时间序列数据集中,所提方法在边缘似然估计方面显著优于Chib方法、幂后验和调和平均估计器。
- 在肺炎球菌传播数据中,该方法的贝叶斯因子估计比RJMCMC更紧密,含季节协变量的模型的对数边缘似然为-263.13。
- 在割伤数据中,含季节协变量的INAR(1)模型的对数边缘似然为-286.0,而标准INAR(1)模型为-298.3,表明显著改进。
- 含协变量的INAR(1)模型相对于标准INAR(1)模型的贝叶斯因子为2984,强烈支持含季节效应的模型。
- 后验估计显示λ(感染强度)随季节显著变化,而α(持续性)保持相对稳定,支持季节性传播模式。
- 该方法表现出稳健性和计算效率,尤其在RJMCMC因模型间结构差异而失效的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。