Skip to main content
QUICK REVIEW

[论文解读] A Framework for Implementing Machine Learning on Omics Data

Geoffroy Dubourg-Felonneau, Timothy I. Cannings|arXiv (Cornell University)|Nov 26, 2018
Bioinformatics and Genomic Networks参考文献 6被引用 6
一句话总结

本文提出了一种机器学习框架,用于整合来自不同来源(如微阵列和RNA-Seq数据集)的多组学数据,生成统一的高维数据集,以提升临床预测性能。通过整合来自3,533名乳腺癌患者的METABRIC、TCGA微阵列和TCGA RNA-Seq数据,该框架在联合数据上使用SVM-RBF模型实现高达0.81的AUC,相比单一数据集,显著提升了生存预测的准确性和稳定性。

ABSTRACT

The potential benefits of applying machine learning methods to -omics data are becoming increasingly apparent, especially in clinical settings. However, the unique characteristics of these data are not always well suited to machine learning techniques. These data are often generated across different technologies in different labs, and frequently with high dimensionality. In this paper we present a framework for combining -omics data sets, and for handling high dimensional data, making -omics research more accessible to machine learning applications. We demonstrate the success of this framework through integration and analysis of multi-analyte data for a set of 3,533 breast cancers. We then use this data-set to predict breast cancer patient survival for individuals at risk of an impending event, with higher accuracy and lower variance than methods trained on individual data-sets. We hope that our pipelines for data-set generation and transformation will open up -omics data to machine learning researchers. We have made these freely available for noncommercial use at www.ccg.ai.

研究动机与目标

  • 解决在多种来源和技术平台下整合高维异质组学数据以支持机器学习应用的挑战。
  • 通过整合组学数据,提升乳腺癌患者短期生存预测的准确性并降低方差。
  • 开发可复现的开源工具链,使研究人员能够对组学数据进行预处理、转换并应用机器学习模型。
  • 展示数据整合与降维技术在提升临床结局预测模型性能方面的有效性。
  • 通过提供标准化的预处理与建模工作流,使高维组学数据更易于被机器学习研究人员使用。

提出的方法

  • 该框架整合了来自METABRIC、TCGA微阵列和TCGA RNA-Seq数据集的基因表达(RNA-Seq与微阵列)及拷贝数异常(CNA)数据,对不同平台的患者与基因进行对齐。
  • 通过3,533名患者的并集与15,233个交集基因对数据进行归一化与整合,同时保留生物学相关性,如整合性亚型分类。
  • 临床生存数据通过设定生存时间阈值(24个月与60个月)进行处理,通过min(T_i, L_i)方法处理删失,生成二元标签。
  • 管道使用t-SNE进行降维,将高维数据投影至低维空间(如3D、15D),以提升模型泛化能力。
  • 在原始数据或投影数据上训练多种分类器(包括RBF核SVM、高斯过程、MLP及随机投影集成),并通过10折交叉验证调整超参数。
  • 使用神经网络回归器估计生存函数S_T(t),最小化预测值与删失生存时间之间的均方误差。

实验结果

研究问题

  • RQ1整合来自异质来源(如微阵列与RNA-Seq)的多组学数据是否能提升机器学习在预测乳腺癌生存方面的性能?
  • RQ2通过t-SNE进行降维是否能提升机器学习模型在高维组学数据上的预测性能?
  • RQ3与基于单一数据集训练的模型相比,联合数据上模型的AUC与方差表现如何?
  • RQ4统一的工具链是否能简化非专业机器学习研究人员对组学数据的预处理与建模流程?
  • RQ5数据整合与特征投影对生存预测模型的稳定性与准确性有何影响?

主要发现

  • 整合来自METABRIC、TCGA微阵列与TCGA RNA-Seq的3,533名乳腺癌患者的联合数据集保留了关键生物学特征,包括整合性亚型中不同的无病生存模式。
  • 在联合RNA-Seq与微阵列数据上训练的RBF核SVM模型达到0.815的AUC,显著优于仅使用METABRIC数据的0.662 AUC。
  • t-SNE投影提升了模型性能,高斯过程分类器在3D t-SNE投影上达到0.755 AUC,而原始数据上仅为0.500。
  • 随机投影集成分类器在保留测试集上对2年与5年生存预测的AUC分别达到0.76与0.79。
  • 神经网络回归器在原始数据上验证AUC达0.720,证明其在估计连续生存函数方面的有效性。
  • 相比在单一数据集上训练的模型,该框架显著降低了模型方差并提升了准确性,在多种算法上均表现出一致改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。