Skip to main content
QUICK REVIEW

[论文解读] Surrogate Assisted Semi-supervised Inference for High Dimensional Risk Prediction

Jue Hou, Zijian Guo|PubMed|May 4, 2021
Genetic Associations and Epidemiology参考文献 39被引用 5
一句话总结

本文提出了一种代理辅助的半监督学习(SAS)方法,用于使用包含预测因子和结果代理的大型未标记数据集,以及包含真实结果的小型标记数据集,进行高维风险预测。通过在稀疏插补模型中结合矩条件和一步偏差校正,SAS 即使在模型误设和密集风险模型下也能实现有效的推断,在模拟和2型糖尿病的真实世界遗传风险预测中表现出优越性能。

ABSTRACT

Risk modeling with electronic health records (EHR) data is challenging due to no direct observations of the disease outcome and the high-dimensional predictors. In this paper, we develop a surrogate assisted semi-supervised learning approach, leveraging small labeled data with annotated outcomes and extensive unlabeled data of outcome surrogates and high-dimensional predictors. We propose to impute the unobserved outcomes by constructing a sparse imputation model with outcome surrogates and high-dimensional predictors. We further conduct a one-step bias correction to enable interval estimation for the risk prediction. Our inference procedure is valid even if both the imputation and risk prediction models are misspecified. Our novel way of ultilizing unlabelled data enables the high-dimensional statistical inference for the challenging setting with a dense risk prediction model. We present an extensive simulation study to demonstrate the superiority of our approach compared to existing supervised methods. We apply the method to genetic risk prediction of type-2 diabetes mellitus using an EHR biobank cohort.

研究动机与目标

  • 解决在真实疾病结局未被观测且获取成本高昂的情况下,电子健康记录(EHR)中高维风险预测的挑战。
  • 开发一种半监督学习框架,利用包含预测因子和结果代理的未标记数据,以及包含真实结果的小型标记数据集。
  • 即使在基础风险模型为密集或误设的情况下,也确保风险预测的统计推断有效性。
  • 通过 EHR 生物库数据,提高复杂疾病(如2型糖尿病)的遗传风险预测的准确性和鲁棒性。

提出的方法

  • SAS 方法使用稀疏工作插补模型,从大型未标记数据集中的代理和预测因子估计未观测到的真实结果。
  • 通过引入矩条件,确保对插补模型误设的鲁棒性。
  • 应用一步偏差校正,以实现预测风险的有效区间估计。
  • 将代理结果(如 ICD 编码或自然语言处理提及)与高维预测因子结合,以提高插补准确性。
  • 采用两阶段估计程序:首先,使用代理和预测因子插补缺失结果;其次,校正最终风险预测中的偏差。
  • 在高维设定下推导理论保证,包括估计风险系数的一致性和渐近正态性。

实验结果

研究问题

  • RQ1半监督学习方法能否有效利用包含结果代理的大规模未标记 EHR 数据,以改善高维风险预测?
  • RQ2当真实风险模型为密集或误设时,如何保持有效的统计推断?
  • RQ3与仅使用标记数据的监督方法相比,引入代理能在多大程度上提高预测准确性?
  • RQ4所提出的方法能否在高维设定下实现风险预测的可靠区间估计?
  • RQ5SAS 方法在真实世界中复杂疾病(如2型糖尿病)的遗传风险预测中表现如何?

主要发现

  • 即使在基础风险模型为密集且工作插补模型误设的情况下,SAS 程序仍能为预测风险提供有效推断。
  • 在模拟中,SAS 方法在预测准确性和置信区间覆盖方面优于现有监督方法。
  • 在真实 EHR 数据中,ICD 编码的阳性预测值(PPV)达到 48%,NLP 提及 T2DM 的 PPV 为 19%,表明代理辅助校正的必要性。
  • 一步偏差校正成功减少了估计偏差,实现了高维风险预测的准确区间估计。
  • 该方法在各种模型误设和高维设定下表现出稳健性能,理论一致性与渐近正态性已得到证明。
  • 在生物库队列中的应用表明,与标准监督方法相比,SAS 方法显著改善了2型糖尿病的遗传风险预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。