Skip to main content
QUICK REVIEW

[论文解读] BioMM: Biologically-informed Multi-stage Machine learning for identification of epigenetic fingerprints

Junfang Chen, Emanuel Schwarz|arXiv (Cornell University)|Dec 1, 2017
Biometric Identification and Security被引用 5
一句话总结

BioMM 是一种生物学启发的多阶段机器学习框架,通过在应用集成学习前使用基因本体论类别对DNA甲基化数据进行分层,从而提高精神分裂症表观遗传指纹的识别能力。该方法在独立测试数据上预测精神分裂症状态时,显著优于传统机器学习方法,通过生物上有意义的数据聚合,展现出更高的可重复性和准确性。

ABSTRACT

The identification of reproducible biological patterns from high-dimensional data is a bottleneck for understanding the biology of complex illnesses such as schizophrenia. To address this, we developed a biologically informed, multi-stage machine learning (BioMM) framework. BioMM incorporates biological pathway information to stratify and aggregate high-dimensional biological data. We demonstrate the utility of this method using genome-wide DNA methylation data and show that it substantially outperforms conventional machine learning approaches. Therefore, the BioMM framework may be a fruitful machine learning strategy in high-dimensional data and be the basis for future, integrative analysis approaches.

研究动机与目标

  • 解决在复杂、异质性疾病(如精神分裂症)的高维表观遗传数据中识别可重复生物模式的挑战。
  • 通过将生物通路信息(基因本体论类别)整合到机器学习中,有意义地降低数据维度。
  • 开发一种框架,以提高精神疾病中DNA甲基化特征的预测准确性和生物可重复性。
  • 通过从通路水平甲基化模式生成生物可解释的合成特征,实现多组学数据的整合分析。
  • 评估该方法对跨数据集异质性及已知混杂因素(如年龄、性别、吸烟、细胞组成)的鲁棒性。

提出的方法

  • 该方法采用两阶段机器学习流程:首先,基于基因本体论(GO)类别分组的DNA甲基化探针,独立训练随机森林模型。
  • 对于每个GO类别,生成袋外(oob)预测作为代表通路水平甲基化模式的合成特征。
  • 将全部2,135个GO类别的这些合成特征汇总至第二阶段模型,用于预测疾病状态(精神分裂症 vs. 对照组)。
  • 通过甲基化探针的残差化处理,对混杂因素(包括吸烟、人群结构(10个主成分)、细胞组成(7种细胞类型)、年龄和性别)进行校正。
  • 第一阶段模型在GSE80417队列(n=675)上训练,第二阶段模型在独立测试集(GSE84727,n=847)上评估。
  • 第二阶段的变量选择聚焦于与结局正相关的预测因子,以减少混杂并提高模型可解释性。

实验结果

研究问题

  • RQ1对高维DNA甲基化数据进行生物学启发的分层,是否能提高精神疾病中机器学习模型的可重复性和准确性?
  • RQ2通过多阶段学习方法整合通路水平甲基化模式,是否能获得优于传统单阶段机器学习的预测性能?
  • RQ3BioMM框架在考虑已知混杂因素的前提下,能在独立数据集中检测到多大程度上一致的甲基化指纹?
  • RQ4第一阶段预测分数在GO类别中的分布模式,是否能揭示具有不同生物学基础的潜在患者亚群?
  • RQ5BioMM生成的合成特征是否能支持与其他多组学数据模态(如基因表达或遗传关联数据)的整合分析?

主要发现

  • 在独立测试数据集上,BioMM显著优于五种传统机器学习方法,在预测精神分裂症状态方面表现出更高的预测准确性。
  • 该方法通过在2,135个本体类别上对甲基化信号进行生物学上有意义的聚合,实现了更高的预测性能,增强了生物学可重复性。
  • 对混杂因素(包括吸烟、人群结构、细胞组成、年龄和性别)的校正并未消除与疾病相关的甲基化信号,表明方法对已知偏倚具有鲁棒性。
  • 第一阶段预测分数在GO类别中的分布揭示了具有不同通路水平甲基化改变的潜在患者亚群,支持精神分裂症存在生物学异质性的假设。
  • 第一阶段生成的合成特征有效捕捉了生物相关信号,第二阶段模型的性能优于使用原始甲基化数据的模型。
  • 该框架在整合分析中具有实用性,且可扩展至其他数据模态(如基因表达或遗传关联数据)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。