Skip to main content
QUICK REVIEW

[论文解读] spikeSlabGAM: Bayesian Variable Selection, Model Choice and Regularization for Generalized Additive Mixed Models in R

Fabian Scheipl|arXiv (Cornell University)|May 26, 2011
Statistical Methods and Bayesian Inference被引用 8
一句话总结

本论文介绍了 R 包 spikeSlabGAM,该包可在高斯、贝努利和泊松响应的广义可加混合模型(GAMMs)中实现贝叶斯变量选择、模型选择与正则化。该方法采用一种新颖的“峰-泥”先验结构,对系数组进行建模,可同时选择相关协变量、判断其效应是否为线性或平滑,并估计其函数形式,即使在包含数千个观测值和数百个系数的高维设置下,也能实现稳定的推断。

ABSTRACT

The R package spikeSlabGAM implements Bayesian variable selection, model choice, and regularized estimation in (geo-)additive mixed models for Gaussian, binomial, and Poisson responses. Its purpose is to (1) choose an appropriate subset of potential covariates and their interactions, (2) to determine whether linear or more flexible functional forms are required to model the effects of the respective covariates, and (3) to estimate their shapes. Selection and regularization of the model terms is based on a novel spike-and-slab-type prior on coefficient groups associated with parametric and semi-parametric effects.

研究动机与目标

  • 为解决在高维广义可加混合模型中选择相关协变量并确定适当函数形式(线性与平滑)的挑战。
  • 开发一个完全的贝叶斯框架,实现对各类模型项(包括线性、平滑、随机和空间效应)的联合估计、模型选择与正则化。
  • 将“峰-泥”先验从单个系数扩展至与模型项相关的系数块,实现项级选择。
  • 提供一个可扩展的开源 R 实现,支持模型平均、可视化和非高斯响应的预测。
  • 在统一的贝叶斯框架中实现变量选择与正则化的同时,区分线性与非线性效应。

提出的方法

  • 在与模型项相关的系数组上使用“峰-泥”先验结构,其中“峰”部分表示从模型中排除,“泥”部分表示包含并允许灵活估计。
  • 对回归系数的超方差施加双模态先验,形成两组分混合,从而实现每个模型项的边际后验包含概率。
  • 采用马尔可夫链蒙特卡洛(MCMC)抽样方法,结合 P-样条估计平滑项,并对各类效应(线性、平滑、随机、空间)使用条件高斯先验进行正则化估计。
  • 实现一种带削薄和多条并行马尔可夫链的 P-IWLS(惩罚性迭代重新加权最小二乘)MCMC 算法,以提高收敛性和稳定性。
  • 通过标准 R 公式语法支持模型指定,可灵活包含主效应、交互作用以及复杂项(如固有高斯马尔可夫随机场 IGMRF)。
  • 使用边际后验包含概率(P(gamma=1))作为项重要性的度量,设定显著性阈值(如 >0.25、>0.5、>0.9)以指导解释。

实验结果

研究问题

  • RQ1能否将“峰-泥”先验有效扩展至与 GAMM 中模型项相关的系数块,以实现变量与函数形式的联合选择?
  • RQ2所提出的贝叶斯框架在非高斯响应模型中选择相关协变量并区分线性与平滑效应方面的表现如何?
  • RQ3与标准 GAMM 方法相比,模型平均与正则化对预测性能的影响如何?
  • RQ4该方法在大规模数据集和高维系数空间下,其计算效率与收敛稳定性如何?
  • RQ5该方法能否在强制执行层次约束(例如,若主效应未被包含,则排除交互效应)的前提下,可靠检测复杂交互作用?

主要发现

  • 该包在皮马印第安人糖尿病数据集中成功识别出关键预测变量,葡萄糖(1.000)和体重(1.000)的后验包含概率极高,表明其作为线性效应被强烈支持。
  • 年龄和体重的平滑效应也表现出高包含概率(分别为 0.996 和 0.973),表明其与糖尿病风险存在强非线性关系。
  • 在测试数据上,模型的预测偏差为 177.85,略优于基准模型(180.51),表明通过有信息的变量与函数形式选择,预测精度得到提升。
  • 对于重要性较低的变量如怀孕次数和血压,其边际后验包含概率较低(分别为 0.069 和 0.117),表明其对模型贡献可能不显著。
  • 该方法在包含数千个观测值和数百个系数的大规模数据集上表现出可扩展性,由于后验分布存在多峰性,需依赖多条并行 MCMC 链以实现稳定推断。
  • 该实现支持广泛的模型类型,包括高斯、贝努利、泊松和分段指数模型,适用于多样化的回归问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。