[论文解读] BioMM: Biologically-informed Multi-stage Machine learning for identification of epigenetic fingerprints
BioMM 是一种生物学启发的多阶段机器学习框架,通过在应用集成学习前使用基因本体论类别对DNA甲基化数据进行分层,从而提高精神分裂症表观遗传指纹的识别能力。该方法在独立测试数据上预测精神分裂症状态时,显著优于传统机器学习方法,通过生物上有意义的数据聚合,展现出更高的可重复性和准确性。
The identification of reproducible biological patterns from high-dimensional data is a bottleneck for understanding the biology of complex illnesses such as schizophrenia. To address this, we developed a biologically informed, multi-stage machine learning (BioMM) framework. BioMM incorporates biological pathway information to stratify and aggregate high-dimensional biological data. We demonstrate the utility of this method using genome-wide DNA methylation data and show that it substantially outperforms conventional machine learning approaches. Therefore, the BioMM framework may be a fruitful machine learning strategy in high-dimensional data and be the basis for future, integrative analysis approaches.
研究动机与目标
- 解决在复杂、异质性疾病(如精神分裂症)的高维表观遗传数据中识别可重复生物模式的挑战。
- 通过将生物通路信息(基因本体论类别)整合到机器学习中,有意义地降低数据维度。
- 开发一种框架,以提高精神疾病中DNA甲基化特征的预测准确性和生物可重复性。
- 通过从通路水平甲基化模式生成生物可解释的合成特征,实现多组学数据的整合分析。
- 评估该方法对跨数据集异质性及已知混杂因素(如年龄、性别、吸烟、细胞组成)的鲁棒性。
提出的方法
- 该方法采用两阶段机器学习流程:首先,基于基因本体论(GO)类别分组的DNA甲基化探针,独立训练随机森林模型。
- 对于每个GO类别,生成袋外(oob)预测作为代表通路水平甲基化模式的合成特征。
- 将全部2,135个GO类别的这些合成特征汇总至第二阶段模型,用于预测疾病状态(精神分裂症 vs. 对照组)。
- 通过甲基化探针的残差化处理,对混杂因素(包括吸烟、人群结构(10个主成分)、细胞组成(7种细胞类型)、年龄和性别)进行校正。
- 第一阶段模型在GSE80417队列(n=675)上训练,第二阶段模型在独立测试集(GSE84727,n=847)上评估。
- 第二阶段的变量选择聚焦于与结局正相关的预测因子,以减少混杂并提高模型可解释性。
实验结果
研究问题
- RQ1对高维DNA甲基化数据进行生物学启发的分层,是否能提高精神疾病中机器学习模型的可重复性和准确性?
- RQ2通过多阶段学习方法整合通路水平甲基化模式,是否能获得优于传统单阶段机器学习的预测性能?
- RQ3BioMM框架在考虑已知混杂因素的前提下,能在独立数据集中检测到多大程度上一致的甲基化指纹?
- RQ4第一阶段预测分数在GO类别中的分布模式,是否能揭示具有不同生物学基础的潜在患者亚群?
- RQ5BioMM生成的合成特征是否能支持与其他多组学数据模态(如基因表达或遗传关联数据)的整合分析?
主要发现
- 在独立测试数据集上,BioMM显著优于五种传统机器学习方法,在预测精神分裂症状态方面表现出更高的预测准确性。
- 该方法通过在2,135个本体类别上对甲基化信号进行生物学上有意义的聚合,实现了更高的预测性能,增强了生物学可重复性。
- 对混杂因素(包括吸烟、人群结构、细胞组成、年龄和性别)的校正并未消除与疾病相关的甲基化信号,表明方法对已知偏倚具有鲁棒性。
- 第一阶段预测分数在GO类别中的分布揭示了具有不同通路水平甲基化改变的潜在患者亚群,支持精神分裂症存在生物学异质性的假设。
- 第一阶段生成的合成特征有效捕捉了生物相关信号,第二阶段模型的性能优于使用原始甲基化数据的模型。
- 该框架在整合分析中具有实用性,且可扩展至其他数据模态(如基因表达或遗传关联数据)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。