[论文解读] Projection Predictive Inference for Generalized Linear and Additive Multilevel Models
该论文将投影预测推断扩展至广义线性混合模型(GLMMs)和广义可加混合模型(GAMMs),通过基于预测性能的顺序前向选择,将完整参考模型的后验分布投影到低维子模型中,实现了稳健的变量与结构选择。该方法在减少最多60%的模型项数的同时,仍能实现接近最优的预测准确度,展现出良好的频率性质与稳定性,即使在高相关性或复杂分组结构下亦表现稳健。
Projection predictive inference is a decision theoretic Bayesian approach that decouples model estimation from decision making. Given a reference model previously built including all variables present in the data, projection predictive inference projects its posterior onto a constrained space of a subset of variables. Variable selection is then performed by sequentially adding relevant variables until predictive performance is satisfactory. Previously, projection predictive inference has been demonstrated only for generalized linear models (GLMs) and Gaussian processes (GPs) where it showed superior performance to competing variable selection procedures. In this work, we extend projection predictive inference to support variable and structure selection for generalized linear multilevel models (GLMMs) and generalized additive multilevel models (GAMMs). Our simulative and real-word experiments demonstrate that our method can drastically reduce the model complexity required to reach reference predictive performance and achieve good frequency properties.
研究动机与目标
- 为广义线性混合模型(GLMMs)和广义可加混合模型(GAMMs)缺乏可靠的变量与结构选择方法提供解决方案。
- 将投影预测推断——此前仅限于广义线性模型(GLMs)和高斯过程(GPs)——扩展至支持多水平与加法结构。
- 确保在非高斯、分层模型中投影的可识别性与计算可行性。
- 通过大量模拟实验与真实世界数据实验验证该方法的性能。
- 在开源 projpred R 包中实现该方法,以提升其可及性。
提出的方法
- 通过拉普拉斯近似计算投影模型的边际似然,将投影预测推断适配于GLMMs和GAMMs。
- 采用前向搜索策略,按顺序将变量逐个加入投影,选择能使预测分布与参考模型后验差异最小化的变量(以Kullback-Leibler散度衡量)。
- 将完整参考模型的后验分布投影到一个受限子空间中,其中被排除变量的系数被固定为零,从而保留被排除成分的不确定性。
- 采用决策理论框架,将模型估计与变量选择解耦,确保预测的一致性。
- 以期望对数预测密度(ELPD)为主要标准,评估预测性能并指导变量的纳入。
- 通过在固定效应与随机效应上施加超先验,实现正则化,以在高相关性或稀疏数据条件下稳定投影结果。
实验结果
研究问题
- RQ1投影预测推断能否推广至GLMMs与GAMMs?此前因可识别性问题,该方法无法直接应用。
- RQ2在预测变量间相关性与分组结构复杂性不同的情况下,该方法在多水平与加法模型中选择相关变量与结构的性能如何?
- RQ3为匹配完整参考模型的预测性能,所需投影模型的最优规模是多少?
- RQ4在高相关性或存在大量分组因子的情况下,该方法在识别真正相关效应时的真正阳性率与假阳性率表现如何?
- RQ5该方法在不同数据结构(包括稀疏或高度相关设计)下,其稳健性与稳定性如何保持?
主要发现
- 该方法平均可将模型项数减少最多60%,同时保持与参考模型相当的预测性能(以ELPD衡量),显著降低模型复杂度。
- 随着预测变量间相关性的增加,最优投影模型规模减小,表明在高相关性设定下选择效率更高。
- 该方法具有高度稳健性,所有模拟条件下平均性能估计的95%后验可信区间均较窄,表明结果稳定。
- 假阳性率随分组因子数量与相关性增加而上升,但在相关性达0.9时,方法仍能识别出约一半真正相关的效应。
- 该方法表现出良好的频率性质,所选子模型的预测性能在各种数据配置下始终接近完整参考模型。
- 通过拉普拉斯近似,随机效应与加法平滑项的纳入得到有效处理,使复杂模型中的投影稳定且可识别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。