[论文解读] Identifying Genetic Risk Factors via Sparse Group Lasso with Group Graph Structure
该论文提出SGLGG,一种两级结构稀疏模型,通过稀疏组Lasso和图引导融合Lasso,将核苷酸水平和基因水平的稀疏性与基因网络先验相结合。采用ADMM优化方法,SGLGG在预测阿尔茨海默病相关表型方面优于最先进模型,并识别出与AD风险相关的生物上合理的聚类SNP,展示了在ADNI全基因组测序和神经影像数据上更高的可解释性和变量选择性能。
Genome-wide association studies (GWA studies or GWAS) investigate the relationships between genetic variants such as single-nucleotide polymorphisms (SNPs) and individual traits. Recently, incorporating biological priors together with machine learning methods in GWA studies has attracted increasing attention. However, in real-world, nucleotide-level bio-priors have not been well-studied to date. Alternatively, studies at gene-level, for example, protein--protein interactions and pathways, are more rigorous and legitimate, and it is potentially beneficial to utilize such gene-level priors in GWAS. In this paper, we proposed a novel two-level structured sparse model, called Sparse Group Lasso with Group-level Graph structure (SGLGG), for GWAS. It can be considered as a sparse group Lasso along with a group-level graph Lasso. Essentially, SGLGG penalizes the nucleotide-level sparsity as well as takes advantages of gene-level priors (both gene groups and networks), to identifying phenotype-associated risk SNPs. We employ the alternating direction method of multipliers algorithm to optimize the proposed model. Our experiments on the Alzheimer's Disease Neuroimaging Initiative whole genome sequence data and neuroimage data demonstrate the effectiveness of SGLGG. As a regression model, it is competitive to the state-of-the-arts sparse models; as a variable selection method, SGLGG is promising for identifying Alzheimer's disease-related risk SNPs.
研究动机与目标
- 解决传统GWAS忽略SNP互作和生物先验的局限性。
- 开发一种联合在核苷酸水平和基因水平施加稀疏性的模型,以改善致病SNP的识别。
- 将具有生物意义的基因水平先验(如蛋白质-蛋白质相互作用和通路)整合到SNP选择中,以增强生物可解释性。
- 使用高效的基于ADMM的算法优化具有多个正则化项的复杂结构稀疏模型。
- 在真实世界的阿尔茨海默病基因组和神经影像数据上,评估模型在回归和变量选择任务中的性能。
提出的方法
- 提出SGLGG,一种结合稀疏组Lasso和组级图Lasso的混合模型,以在核苷酸和基因水平同时诱导稀疏性。
- 通过基因水平系数的图结构惩罚,整合基因水平的生物先验(如蛋白质-蛋白质相互作用、通路)。
- 将基因网络中的边约束转化为矩阵形式,以实现高效优化。
- 采用交替方向乘子法(ADMM)求解具有多个正则化项的非光滑、非凸优化问题。
- 使用100次模拟的稳定性选择,评估不同正则化参数下SNP选择的可靠性和一致性。
实验结果
研究问题
- RQ1与现有稀疏模型相比,是否两级结构稀疏模型(整合核苷酸水平和基因水平稀疏性)能提升GWAS中的预测准确性?
- RQ2SGLGG在多大程度上能有效利用基因水平的生物先验(如蛋白质-蛋白质相互作用网络)来识别与阿尔茨海默病相关的生物上一致的SNP聚类?
- RQ3SGLGG是否在通过变量选择识别致病SNP方面优于最先进稀疏模型,特别是在稳定性和生物合理性方面?
- RQ4图结构正则化的引入在多大程度上增强了GWAS中基因间SNP-SNP互作的检测能力?
- RQ5SGLGG是否能在保持强大预测性能的同时,通过结构稀疏性和先验整合实现更优的可解释性?
主要发现
- SGLGG在预测阿尔茨海默病相关表型方面表现出具有竞争力的回归性能,在均方误差(MSE)方面优于或匹配最先进稀疏模型。
- 稳定性选择显示,SGLGG在特定基因内选择紧密聚集的SNP,而Lasso或SGL则将选择分散在多个基因中。
- SGLGG选择的总基因数更少,但在每个选定基因中选择了更多相关SNP,表明其在核苷酸水平稀疏性和基因水平分组方面均具有效性。
- 该模型识别出与阿尔茨海默病具有高度生物相关性的SNP,即使这些SNP的个体P值并非最小,表明其能捕捉超越边际显著性的生物有意义信号。
- 基因网络先验的整合使SGLGG能够检测到跨基因的潜在SNP-SNP互作,支持其在揭示复杂遗传结构方面的作用。
- 基于ADMM的优化算法有效处理了SGLGG中的复杂正则化项,实现了全基因组测序数据上可扩展且稳定的训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。