[论文解读] Group-sparse SVD Models and Their Applications in Biological Data
本文提出了群稀疏SVD模型——GL₁-SVD、GL₀-SVD、OGL₁-SVD和OGL₀-SVD——将先验生物学知识(例如基因通路)整合到低秩矩阵分解中,用于高维基因表达数据的双聚类分析。通过结合非重叠与重叠群结构的组套索和L₀-范数惩罚,该方法提升了生物学可解释性,并识别出比现有最先进稀疏SVD方法更相关的基因模块。
Sparse Singular Value Decomposition (SVD) models have been proposed for biclustering high dimensional gene expression data to identify block patterns with similar expressions. However, these models do not take into account prior group effects upon variable selection. To this end, we first propose group-sparse SVD models with group Lasso (GL1-SVD) and group L0-norm penalty (GL0-SVD) for non-overlapping group structure of variables. However, such group-sparse SVD models limit their applicability in some problems with overlapping structure. Thus, we also propose two group-sparse SVD models with overlapping group Lasso (OGL1-SVD) and overlapping group L0-norm penalty (OGL0-SVD). We first adopt an alternating iterative strategy to solve GL1-SVD based on a block coordinate descent method, and GL0-SVD based on a projection method. The key of solving OGL1-SVD is a proximal operator with overlapping group Lasso penalty. We employ an alternating direction method of multipliers (ADMM) to solve the proximal operator. Similarly, we develop an approximate method to solve OGL0-SVD. Applications of these methods and comparison with competing ones using simulated data demonstrate their effectiveness. Extensive applications of them onto several real gene expression data with gene prior group knowledge identify some biologically interpretable gene modules.
研究动机与目标
- 解决现有稀疏SVD模型忽略基因表达数据中先验生物群结构的局限性。
- 开发结合非重叠与重叠群信息(如基因通路)的结构化稀疏SVD模型,以提升生物学可解释性。
- 提出高效的优化算法——采用块坐标下降、投影方法和ADMM——求解所得群稀疏SVD问题。
- 在模拟和真实基因表达数据集上验证模型,证明其在识别生物意义明确的基因模块方面具有优势。
- 在未来工作中将稀疏SVD的适用性扩展至高维生物数据,包括单细胞RNA-seq和多组学数据。
提出的方法
- 提出GL₁-SVD和GL₀-SVD,分别采用非重叠群套索和L₀-范数惩罚,以在奇异向量中诱导结构化稀疏性。
- 对GL₁-SVD使用块坐标下降法,对GL₀-SVD使用基于投影的方法求解优化问题。
- 提出OGL₁-SVD和OGL₀-SVD以建模重叠群结构,其中基因可属于多个通路。
- 开发基于ADMM的算法,用于计算OGL₁-SVD中重叠群套索的近端算子。
- 由于L₀-范数惩罚的非凸性,采用贪心近似方法求解OGL₀-SVD问题。
- 使用交替迭代优化方法,联合估计低秩逼近和群稀疏奇异向量。
实验结果
研究问题
- RQ1具有非重叠群惩罚的群稀疏SVD模型是否能提升在基因表达数据中识别生物一致基因模块的能力?
- RQ2与非重叠模型相比,整合重叠群结构(如同时属于多个通路的基因)如何提升双聚类的可解释性和准确性?
- RQ3OGL₁-SVD和OGL₀-SVD在计算和统计性能上相较于现有稀疏SVD和基于NMF的方法表现如何?
- RQ4所提出的模型在真实基因表达数据集中,能在多大程度上恢复已知的生物学关系(如组织特异性通路或癌症亚型)?
- RQ5所提出的群稀疏SVD模型能否扩展至其他高维生物数据类型,如单细胞RNA-seq或多组学数据?
主要发现
- OGL₀-SVD模型从CGP + KEGG数据集中识别出十个基因功能模块,每个模块在至少一种癌症或组织类型中显著富集(p < 0.05,超几何检验)。
- 模块1仅与血液组织相关,且在与B细胞受体信号传导和原发性免疫缺陷相关的五个KEGG通路中显著富集。
- 模块6特异性关联大肠、肝癌和胃肠道组织,且在补体和凝血级联反应及PPAR信号通路中显著富集。
- OGL₀-SVD的前十个奇异向量对解释了CGP + KEGG数据集中超过60%的总方差,表明其有效捕捉了强低秩结构。
- 与现有最先进稀疏SVD方法相比,所提出的群稀疏模型识别出更多具有生物学可解释性和功能一致性的基因模块。
- OGL₁-SVD和OGL₀-SVD模型在优化过程中表现出计算可行性与收敛性,ADMM和贪心近似方法有效求解了重叠群问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。