[论文解读] Bayesian Sparse Global-Local Shrinkage Regression for Selection of Grouped Variables
本文提出了一种基于正态分布和正态分布+先验的贝叶斯分组全局-局部收缩回归模型,用于处理高维数据中的重叠和多层分组结构。该方法将解耦收缩与选择(DSS)方法扩展至分组层面的变量选择,并引入了一种改进的自由度估计器,在稀疏分组设置下,相较于现有方法(如BSGS),实现了更优的分组选择准确率和预测性能。
Most estimates for penalised linear regression can be viewed as posterior modes for an appropriate choice of prior distribution. Bayesian shrinkage methods, particularly the horseshoe estimator, have recently attracted a great deal of attention in the problem of estimating sparse, high-dimensional linear models. This paper extends these ideas, and presents a Bayesian grouped model with continuous global-local shrinkage priors to handle complex group hierarchies that include overlapping and multilevel group structures. As the posterior mean is never a sparse estimate of the linear model coefficients, we extend the recently proposed decoupled shrinkage and selection (DSS) technique to the problem of selecting groups of variables from posterior samples. To choose a final, sparse model, we also adapt generalised information criteria approaches to the DSS framework. To ensure that sparse groups, in which only a few predictors are active, can be effectively identified, we provide an alternative degrees of freedom estimator for sparse Bayesian linear models that takes into account the effects of shrinkage on the model coefficients. Simulations and real data analysis using our proposed method show promising performance in terms of correct identification of active and inactive groups, and prediction, in comparison with a Bayesian grouped slab-and-spike approach.
研究动机与目标
- 解决具有复杂分组结构(包括重叠和多层分组)的稀疏高维回归模型选择挑战。
- 通过在分组层面整合解耦收缩与选择(DSS)框架,克服连续收缩先验在产生非稀疏后验均值方面的局限性。
- 通过将广义信息准则(GICs)适配至DSS框架并引入改进的自由度估计器,提升分组贝叶斯回归中的模型选择性能。
- 实现在稀疏模型中高效且准确地识别活跃分组,尤其当某一组内仅有少数预测变量真正相关时。
- 在小样本和高维设置下,相较于现有贝叶斯分组方法(如BSGS),展示出更优的预测性能和分组选择准确率。
提出的方法
- 提出一种具有全局-局部收缩先验(正态分布和正态分布+)的分层贝叶斯模型,用于分组回归系数,实现对重叠和多层分组结构的灵活收缩。
- 将解耦收缩与选择(DSS)方法扩展至分组层面,通过分组非负套索程序将后验均值收缩与分组选择分离。
- 提出一种新颖的分组非负套索解的自由度估计器,考虑了对系数估计的收缩效应,从而提升模型选择准确率。
- 将四种信息准则——决定系数解释方差、过度误差、BIC* 和 AIC*——适配至分组DSS框架,用于选择最终稀疏模型。
- 采用MCMC后验抽样获得分组系数的后验分布,随后基于DSS进行稀疏化处理,并利用GICs进行模型选择。
- 采用重参数化策略对预测变量进行标准化并使响应变量中心化,以确保在高维设置下的稳定性与可解释性。
实验结果
研究问题
- RQ1全局-局部收缩先验能否有效扩展至具有重叠和多层分组结构的分组回归模型?
- RQ2如何将解耦收缩与选择(DSS)方法适配至分组层面的变量选择,同时保持计算效率?
- RQ3与标准估计器相比,所提出的分组非负套索的自由度估计器是否能在稀疏分组设置下提升模型选择准确率?
- RQ4在分组选择准确率和预测误差方面,所提出方法相较于贝叶斯分组板-刺(BSGS)方法的表现如何?
- RQ5适配至分组DSS框架的信息准则是否能在高维稀疏回归问题中超越启发式模型选择规则?
主要发现
- 在使用后验期望自由度时,四种信息准则(决定系数解释方差、过度误差、BIC*、AIC*)均得到相同的分组选择结果,表明模型选择具有鲁棒性。
- 在出生体重数据集中,最终模型选中了五个分组:LWT、LWT²、LWT³、RACE(黑人-白人与其他人-白人)、SMOKE、HT 和 UI,为保持可比性,未包含交互项。
- 与BSGS方法相比,所提方法将均方预测误差降低了5.8%–6.0%,在AIC*、AICc* 和 BIC* 准则下误差比值为0.940–0.946。
- 后验均值估计的预测误差最低(比值为0.906),但其并非稀疏;相比之下,基于DSS的模型选择方法生成了稀疏模型,且预测性能接近最优。
- 使用小样本信息准则(如AICc*)显著优于Hahn和Carvalho(2015)原始提出的启发式准则,尤其在高维和稀疏设置下表现更优。
- 该方法在分组识别准确率上与BSGS相当,但计算成本显著降低,使其在大规模高维分组回归问题中具备良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。