Skip to main content
QUICK REVIEW

[论文解读] Sequential double cross-validation for augmented prediction assessment in high-dimensional omic applications

Mar Rodríguez‐Girondo, Perttu Salo|arXiv (Cornell University)|Jan 29, 2016
Metabolomics and Mass Spectrometry Studies被引用 3
一句话总结

本文提出一种基于正则化回归的顺序双重交叉验证框架,用于评估在已有的主要组学生物标志物模型(如转录组学)基础上,增加第二个组学生物标志物数据集(如代谢组学)对预测复杂特征(如BMI)的增量预测价值。该方法利用性能指标和置换检验,正式评估第二组学生物标志物层是否在第一层基础上进一步提升预测能力,并在DILGOM队列研究中验证了其有效性。

ABSTRACT

Augmentation of previously established high-dimensional predictive models with new biomolecular markers is an important task in omic applications. We introduce a two-step procedure for the assessment of the augmented predictive value of omic predictors, based on sequential double cross-validation and regularized regression models. We propose several performance indices to summarize the two-stage prediction procedure and a permutation test to formally assess the augmented predictive value of a second omic set of predictors over a primary omic source. The performance of the test is investigated through simulations. We illustrate the new method through the systematic assessment and comparison of the performance of transcriptomics and metabolomics sources in the prediction of body mass index (BMI) using data from the Dietary, Lifestyle, and Genetic determinants of Obesity and Metabolic syndrome (DILGOM) study, a population-based cohort, from Finland.

研究动机与目标

  • 为解决评估在既有的主要组学生物标志物模型(如转录组学)基础上增加第二个组学生物标志物数据集(如代谢组学)是否能提升预测能力的挑战。
  • 开发一种稳健且可重复的框架,用于评估在高维组学生物标志物应用中,因过拟合和数据泄露而带来的增量预测价值。
  • 引入性能指标和置换检验,以正式评估来自次要组学生物标志物源的增量预测价值的显著性。
  • 通过模拟和在DILGOM人群队列研究的真实组学生物标志物数据中应用,验证该方法的性能。
  • 比较转录组学和代谢组学在解释身体质量指数(BMI)变异方面的预测能力。

提出的方法

  • 该方法采用两阶段顺序双重交叉验证程序,以防止数据泄露并确保模型评估的无偏性。
  • 在第一阶段,使用嵌套交叉验证选择最优正则化参数,对主要组学生物标志物模型(如转录组学)进行训练和验证。
  • 在第二阶段,将次要组学生物标志物数据集(如代谢组学)添加到主要模型中,并使用相同的双重交叉验证框架对组合模型进行重新优化和验证。
  • 通过c指数、综合区分改善(IDI)和净重分类改善(NRI)等指标总结性能,这些指标已针对顺序两阶段设计进行调整。
  • 通过在样本间随机打乱次要组学生物标志物预测变量标签,应用置换检验以评估预测性能提升的显著性。
  • 在两个阶段均使用正则化回归模型(如弹性网络)以处理高维预测变量空间并防止过拟合。

实验结果

研究问题

  • RQ1在仅基于转录组学的模型基础上,增加代谢组学数据是否能显著提升BMI预测能力?
  • RQ2如何在不因数据泄露或过拟合而产生偏差的情况下,评估次要组学生物标志物数据集的增量预测价值?
  • RQ3在顺序建模框架中,哪些性能指标最能有效评估第二组学生物标志物层的附加价值?
  • RQ4与标准交叉验证相比,所提出的顺序双重交叉验证程序在偏差和第一类错误控制方面表现如何?
  • RQ5在转录组学模型中增加代谢组学数据后,预测性能的提升是否具有统计学显著性?

主要发现

  • 所提出的顺序双重交叉验证框架在高维组学生物标志物预测任务中能有效控制过拟合和数据泄露。
  • 置换检验为次要组学生物标志物数据集带来的增量预测价值的显著性提供了有效的统计评估。
  • 在DILGOM队列中,将代谢组学数据添加到基于转录组学的模型后,BMI预测能力得到统计显著提升,置换检验结果予以确认。
  • 当将代谢组学添加到主要转录组学模型时,c指数、IDI和NRI等性能指标均显示出一致且有意义的改善。
  • 模拟结果表明,该方法能保持适当的第一类错误率,并具备良好的功效以检测真实的增量预测价值。
  • 该方法可实现对不同组学生物标志物层(如转录组学与代谢组学)在预测复杂特征(如BMI)方面系统且正式的比较。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。