Skip to main content
QUICK REVIEW

[论文解读] Differential gene co-expression networks via Bayesian biclustering models

Chuan Gao, Shiwen Zhao|arXiv (Cornell University)|Nov 7, 2014
Gene expression and cancer classification参考文献 5被引用 7
一句话总结

该论文提出BicMix,一种贝叶斯双聚类模型,通过联合推断基因表达数据在样本子集中的稀疏、过完备表示,识别差异性基因共表达网络。通过在基因和样本共调控中引入诱导稀疏性的先验分布并量化不确定性,BicMix在恢复潜在结构方面优于现有方法,并在乳腺癌数据中检测到具有生物学相关性的、与ER状态相关的共表达网络。

ABSTRACT

Identifying latent structure in large data matrices is essential for exploring biological processes. Here, we consider recovering gene co-expression networks from gene expression data, where each network encodes relationships between genes that are locally co-regulated by shared biological mechanisms. To do this, we develop a Bayesian statistical model for biclustering to infer subsets of co-regulated genes whose covariation may be observed in only a subset of the samples. Our biclustering method, BicMix, has desirable properties, including allowing overcomplete representations of the data, computational tractability, and jointly modeling unknown confounders and biological signals. Compared with related biclustering methods, BicMix recovers latent structure with higher precision across diverse simulation scenarios. Further, we develop a method to recover gene co-expression networks from the estimated sparse biclustering matrices. We apply BicMix to breast cancer gene expression data and recover a gene co-expression network that is differential across ER+ and ER- samples.

研究动机与目标

  • 为解决不相交基因聚类方法的局限性,通过灵活的统计模型实现非不相交、重叠的基因模块。
  • 在仅在部分样本中发生共变的基因表达数据中,恢复潜在的共调控模式。
  • 通过稀疏、过完备表示联合建模未知混杂因素和生物信号,同时保持计算可行性。
  • 构建反映特定条件调控机制的差异性基因共表达网络,例如在ER+和ER-乳腺癌亚型中。

提出的方法

  • BicMix采用贝叶斯层次模型,将基因表达矩阵分解为稀疏载荷矩阵和因子矩阵,并在两者上施加诱导稀疏性的先验分布,以识别小规模、重叠的基因-样本双聚类。
  • 该模型使用变分期望-最大化(VEM)算法,联合估计因子载荷、潜在因子和残差噪声,实现不确定性量化。
  • 通过允许潜在因子数$K$超过样本数$n$,引入过完备表示,增强对小规模、具有生物学意义的共调控模式的敏感性。
  • 基于估计的因子协方差和残差方差构建精度矩阵,计算基因间的偏相关系数,实现网络推断。
  • 该方法应用显著性阈值(边存在的概率≥0.8)和一致性过滤(在≥rep次运行中出现的边)构建稳健、可重复的共表达网络。
  • 提出一种新算法,通过在不同生物条件下对非零因子值进行统计检验(如Mann-Whitney U检验),识别特定子集和差异性双聚类。

实验结果

研究问题

  • RQ1贝叶斯双聚类模型能否有效从高维、$p \gg n$的基因表达数据中恢复重叠的、条件特异性的基因共表达模块?
  • RQ2与传统双聚类和因子模型相比,引入过完备、稀疏表示在多大程度上提升了潜在结构恢复的精度?
  • RQ3BicMix在ER+和ER-乳腺癌等癌症亚型中,能否检测到具有生物学意义的差异性共表达网络?
  • RQ4联合建模混杂因素和生物信号在多大程度上增强了推断基因网络的稳健性和可解释性?
  • RQ5诱导稀疏性的先验分布对恢复具有样本特异性共变性的小型、具有生物学意义的基因簇有何影响?

主要发现

  • 在多种模拟情景下,BicMix在恢复真实潜在结构方面优于竞争方法——Fabia、Plaid、CC、Bimax和谱双聚类,且精度更高。
  • 在包含密集成分的模拟中,BicMix成功恢复了模拟数据中非零元素的正确数量,优于Fabia-truth及其他方法。
  • 对于包含混杂效应的Sim2,BicMix在校正五个主成分后仍保持高精度,表现出对隐藏混杂因素的鲁棒性。
  • 该方法在乳腺癌数据中识别出显著富集于ER状态特异性生物功能的差异性基因共表达网络。
  • 通过一致性过滤构建的最终网络(边在≥50%的运行中出现)包含128个基因和207条边,边的可重复性高,且具有极强的统计显著性(差异成分的p < 1e-10)。
  • 该算法成功提取了特定子集和差异性双聚类,后者在ER+和ER-样本间表现出强有力的统计证据,支持其差异性调控。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。