[论文解读] Bayesian inference for logistic models using Polya-Gamma latent variables
本文提出了一种新颖的数据增强方法,用于贝叶斯逻辑斯蒂回归,利用波利亞-伽馬潜变量,实现了无需梅特ropolis–哈斯廷斯或数值积分的精确吉布斯采样。该方法通过引入一类新的波利亞-伽馬分布,将二项分布似然转化为条件高斯形式,从而在各类模型(包括层次模型和空间模型)中实现了卓越的计算效率和易用性。
We propose a new data-augmentation strategy for fully Bayesian inference in models with binomial likelihoods. The approach appeals to a new class of Polya-Gamma distributions, which are constructed in detail. A variety of examples are presented to show the versatility of the method, including logistic regression, negative binomial regression, nonlinear mixed-effects models, and spatial models for count data. In each case, our data-augmentation strategy leads to simple, effective methods for posterior inference that: (1) circumvent the need for analytic approximations, numerical integration, or Metropolis-Hastings; and (2) outperform other known data-augmentation strategies, both in ease of use and in computational efficiency. All methods, including an efficient sampler for the Polya-Gamma distribution, are implemented in the R package BayesLogit. In the technical supplement appended to the end of the paper, we provide further details regarding the generation of Polya-Gamma random variables; the empirical benchmarks reported in the main manuscript; and the extension of the basic data-augmentation framework to contingency tables and multinomial outcomes.
研究动机与目标
- 解决由于似然函数难以处理而导致的贝叶斯逻辑斯蒂回归中计算效率低下的长期挑战。
- 开发一种简单、精确的数据增强方案,避免使用解析近似、数值积分或梅特ropolis–哈斯廷斯步骤。
- 将该方法扩展至逻辑斯蒂回归之外,适用于具有二项分布、负二项分布和多项分布似然的模型。
- 为波利亞-伽馬变体提供一种快速、自动且可扩展的采样器,以支持在复杂层次模型中的应用。
- 通过一系列真实和合成数据示例,展示该方法在计算效率和有效样本量方面的优越性。
提出的方法
- 引入一类新的波利亞-伽馬分布,定义为一系列独立伽马随机变量的无限级数,其分布记为 PG(b,c),其中 b>0 且 c∈ℝ。
- 建立一个基本积分恒等式:二项分布似然可表示为以波利亞-伽馬分布精度参数 ω 为混合变量的高斯尺度有限混合。
- 推导出给定线性预测器 ψ 时 ω 的条件后验分布为 PG(b, ψ),从而实现具有共轭更新的吉布斯采样方案。
- 利用德夫罗伊(Devroye,1986)的交错级数法,开发 PG(b,c) 的接受/拒绝采样器,PG(1,c) 情况下的统一接受概率界为 0.99919。
- 在 R 包 BayesLogit 中实现该方法,支持逻辑斯蒂回归、负二项回归、非线性混合效应模型和空间模型中的高效后验采样。
- 利用波利亞-伽馬表示,实现回归系数的完整条件高斯更新,同时将 ω 视为潜辅助变量。
实验结果
研究问题
- RQ1能否为贝叶斯逻辑斯蒂回归开发一种简单、精确的数据增强方案,避免使用梅特ropolis–哈斯廷斯和数值积分?
- RQ2波利亞-伽馬表示是否在层次模型和复杂模型中比现有方法带来更高效的后验采样?
- RQ3波利亞-伽馬框架能否扩展至过分散计数模型(如负二项回归)?
- RQ4波利亞-伽馬采样器的计算性能与独立梅特ropolis–哈斯廷斯及其他数据增强方案相比如何?
- RQ5波利亞-伽馬方法能否在大规模或GPU加速环境中高效并行化?
主要发现
- 在空间模型和层次模型中,尽管每次迭代的计算成本更高,波利亞-伽馬方法的有效样本量比竞争方法提高了3至5倍。
- 在数据量充足的简单逻辑斯蒂回归中,波利亞-伽馬方法的效率几乎与经过良好调优的独立梅特ropolis–哈斯廷斯采样器相当。
- 波利亞-伽馬吉布斯采样器表现出均匀遍历性,确保在所有测试场景中稳定且快速收敛。
- PG(1,c) 的接受/拒绝采样器实现了 99.919% 的接受率,使其极为高效,适合在复杂模型中作为黑箱使用。
- 在每个观测值包含大量计数的负二项回归中,波利亞-伽馬方法保持了最高的有效样本量,尽管由于 PG(1,c) 的和结构,其有效采样速率有所降低。
- 该方法实现了具有二项分布似然的复杂层次模型中的精确贝叶斯推断,此前因缺乏可扩展的精确采样器而难以实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。