[论文解读] Scalable Bayesian Variable Selection for Structured High-dimensional Data
该论文提出了一种适用于已知图结构的高维数据的可扩展贝叶斯变量选择方法,通过图正则化的超先验对拉普拉斯先验进行自适应收缩。该方法采用高效的EM算法,计算可扩展性达到p ~ 100,000,在固定和增长维度下均表现出优异的预测性能、变量选择能力以及理论一致性,即使在图结构错误指定的情况下也表现稳健。
Variable selection for structured covariates lying on an underlying known graph is a problem motivated by practical applications, and has been a topic of increasing interest. However, most of the existing methods may not be scalable to high dimensional settings involving tens of thousands of variables lying on known pathways such as the case in genomics studies. We propose an adaptive Bayesian shrinkage approach which incorporates prior network information by smoothing the shrinkage parameters for connected variables in the graph, so that the corresponding coefficients have a similar degree of shrinkage. We fit our model via a computationally efficient expectation maximization algorithm which scalable to high dimensional settings (p~100,000). Theoretical properties for fixed as well as increasing dimensions are established, even when the number of variables increases faster than the sample size. We demonstrate the advantages of our approach in terms of variable selection, prediction, and computational scalability via a simulation study, and apply the method to a cancer genomics study.
研究动机与目标
- 解决在预测变量具有已知图结构(如基因通路)的高维数据中变量选择的挑战。
- 开发一种贝叶斯方法,整合网络先验信息,通过鼓励相连变量的相似收缩来改善变量选择与预测性能。
- 确保在变量数高达100,000的数据集上具备计算可扩展性,克服基于MCMC的贝叶斯方法的局限性。
- 在固定和发散维度下建立理论性质,如Oracle性质与选择一致性。
- 在先验图错误指定的情况下仍保持高性能,同时维持高预测准确率与低假阳性率。
提出的方法
- 在回归系数上使用拉普拉斯先验,对收缩参数设置受图结构影响的超先验,通过在精度矩阵上使用对数正态先验来实现。
- 将收缩参数的精度矩阵建模为图拉普拉斯矩阵,实现对相连变量的收缩平滑化,并对不相连变量实现条件独立。
- EM算法将精度矩阵视为缺失数据,通过对其积分得到观测数据的闭式后验分布,从而实现高效计算。
- 算法整合了动态加权Lasso技术,以提升高维设置下的计算效率。
- 与自适应Lasso不同,该方法不依赖初始权重,且计算效率高于基于MCMC的替代方法。
- 在一般假设下建立了理论性质,包括即使真实图被错误指定,仍保持Oracle性质与选择一致性。
实验结果
研究问题
- RQ1在p ~ 100,000的高维回归中,贝叶斯变量选择方法能否有效整合图结构先验信息?
- RQ2在高维设置下,所提出的方法是否在预测性能与变量选择方面优于现有的频率学派与贝叶斯方法?
- RQ3当变量数超过样本量且图结构错误指定时,该方法能否保持计算可扩展性与理论一致性?
- RQ4在真实基因组学数据中,图信息的整合如何影响假阳性率与生物学可解释性?
- RQ5与标准收缩方法相比,通过图正则化超先验实现的自适应收缩在估计精度方面提升了多少?
主要发现
- 在模拟实验中,所提出的EMSHS方法实现了最低的交叉验证均方预测误差(CV MSPE = 0.975),且计算效率最高,每个调参过程仅需17.0秒。
- EMSHS在预测准确率与计算速度上均优于EMVS与EMVSS,CV MSPE分别为0.975、0.996与0.982。
- 在TCGA癌症基因组学应用中,EMSHS在100次随机划分中至少一次选中了21个基因,其中TOM1L1、RANBP17与BRD7被选中频率最高。
- 所选基因中富含Wnt信号通路,TOM1L1、RANBP17与BRD7的估计系数分别为-0.146、0.181与0.193,与已知在癌症中的作用一致。
- 在模拟场景1、2与5中,EMSHS的假阳性率低于EMSH,表明在正确整合图信息时,其特异性得到提升。
- 理论结果证实,在固定与增长维度下,即使真实图被错误指定,仍保持选择一致性和Oracle性质。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。