[论文解读] Mixed membership analysis of genome-wide expression data
本文提出一种具有混合成员关系与传染过程的分层贝叶斯模型,用于从SAGE数据中识别潜在的基因表达主题,通过捕捉共现特征之间的依赖关系,提升基因功能预测性能。该方法通过变分推断实现软聚类,获得更清晰、更真实的参数估计,优于基于独立性的模型。
Learning latent expression themes that best express complex patterns in a sample is a central problem in data mining and scientific research. For example, in computational biology we seek a set of salient gene expression themes that explain a biological process, extracting them from a large pool of gene expression profiles. In this paper, we introduce probabilistic models to learn such latent themes in an unsupervised fashion. Our models capture contagion, i.e., dependence among multiple occurrences of the same feature, using a hierarchical Bayesian scheme. Contagion is a convenient analytical formalism to characterize semantic themes underlying observed feature patterns, such as biological context. We present model variants tailored to different properties of biological data, and we outline a general variational inference scheme for approximate posterior inference. We validate our methods on both simulated data and realistic high-throughput gene expression profiles via SAGE. Our results show improved predictions of gene functions over existing methods based on stronger independence assumptions, and demonstrate feasibility of a promising hierarchical Bayesian formalism for soft clustering and latent aspects analysis.
研究动机与目标
- 解决现有聚类方法在基因表达分析中假设特征独立性和刚性聚类分配所带来的局限性。
- 通过引入'传染'概念——即重复特征出现之间的依赖关系,对基因表达数据中的复杂生物学变异性进行建模。
- 开发一种灵活的无监督框架,用于识别反映生物学背景的潜在表达主题。
- 在分层贝叶斯结构中整合特定领域的先验知识,以提升推断的鲁棒性。
- 在模拟数据和真实小鼠视网膜SAGE数据上验证模型,证明其在功能预测准确性方面优于现有方法。
提出的方法
- 采用分层贝叶斯模型,其中每个基因的表达是多个潜在主题的混合,使用狄利克雷分布的成员权重(θn)实现软聚类。
- 引入'传染'过程以建模重复特征出现之间的依赖关系,从而更丰富地表示生物学背景。
- 采用通用的变分推断方案,结合平均场近似,实现对潜在参数后验估计的高效计算。
- 使用泊松分布和负二项分布似然函数对基因表达计数进行建模,并在主题特异性率上设置超先验。
- 扩展PoissonL算法,将固定的聚类分配替换为潜在的、狄利克雷分布的成员向量。
- 以序列分析基因表达(SAGE)数据为主要数据源,实现对时间或条件变化下基因表达谱的分析。
实验结果
研究问题
- RQ1具有混合成员关系与传染过程的分层贝叶斯模型,是否能比假设特征独立性的模型更好地捕捉基因表达模式的复杂性?
- RQ2传染过程的引入在SAGE数据中是否能提升对具有生物学意义的表达主题的识别能力?
- RQ3与PoissonL和卡方评分的K均值等现有方法相比,所提出的模型在多大程度上提升了基因功能预测的性能?
- RQ4该模型是否能通过分层结构中的超先验,有效整合特定领域的先验知识?
- RQ5变分推断方法是否能为大规模基因表达数据提供准确且计算可行的后验估计?
主要发现
- 所提出的模型在基因功能预测方面优于依赖更强独立性假设的现有方法。
- 传染过程的引入使特征共现模式的建模更加真实,例如在生物通路中观察到的模式。
- 变分推断为分层模型中的后验近似推断提供了一种可扩展且高效的解决方案。
- 该模型在模拟数据和真实小鼠视网膜SAGE表达谱上均表现出可行性与有效性。
- 通过GO注释进行的生物学验证表明,具有相似功能注释的基因倾向于聚集到同一潜在主题中,表明其具有生物学相关性。
- 与基于独立性的模型相比,该模型生成的估计值更加清晰,表明在真实数据变异性下具有更优的参数估计性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。