Skip to main content
QUICK REVIEW

[论文解读] Leveraging Clinical Time-Series Data for Prediction: A Cautionary Tale

Eli Sherman, Hitinder S. Gurm|PubMed|Nov 29, 2018
Machine Learning in Healthcare参考文献 13被引用 7
一句话总结

本文表明,使用结果依赖的时间点(例如临终或出院时间)作为临床预测模型的训练和评估基准,会导致性能估计过于乐观。通过在两项ICU预测任务(院内死亡率与低钾血症)中对比结果无关(例如入院时间)与结果依赖的索引方式,研究发现结果无关的方法能带来更真实且更高的性能表现(死亡率:AUROC 0.882 vs. 0.831;钾离子水平:0.829 vs. 0.740),凸显了在基于电子病历的机器学习建模中采用临床现实评估框架的迫切需求。

ABSTRACT

In healthcare, patient risk stratification models are often learned using time-series data extracted from electronic health records. When extracting data for a clinical prediction task, several formulations exist, depending on how one chooses the time of prediction and the prediction horizon. In this paper, we show how the formulation can greatly impact both model performance and clinical utility. Leveraging a publicly available ICU dataset, we consider two clinical prediction tasks: in-hospital mortality, and hypokalemia. Through these case studies, we demonstrate the necessity of evaluating models using an outcome-independent reference point, since choosing the time of prediction relative to the event can result in unrealistic performance. Further, an outcome-independent scheme outperforms an outcome-dependent scheme on both tasks (In-Hospital Mortality AUROC .882 vs. .831; Serum Potassium: AUROC .829 vs. .740) when evaluated on test sets that mimic real-world use.

研究动机与目标

  • 探究临床时间序列数据的不同时间索引策略如何影响电子病历基础预测任务中的模型性能与临床实用性。
  • 证明使用结果依赖的参考点(例如临终或出院时间)可能导致模型评估中出现误导性的高性能估计。
  • 倡导在训练与测试中使用结果无关的参考点(如入院时间)以确保性能估计的现实性。
  • 在两项真实世界的ICU预测任务(院内死亡率与低钾血症)中,比较使用不同索引方案训练与评估的模型性能。
  • 提醒研究人员避免使用不反映真实临床部署场景的回顾性数据提取方法。

提出的方法

  • 本研究使用公开的ICU数据集(MIMIC-III),从电子病历中提取时间序列特征,用于两项预测任务:院内死亡率与低钾血症。
  • 采用两种索引策略:结果依赖型(例如相对于死亡或出院时间)与结果无关型(例如入院时间),用于训练集与测试集的构建。
  • 对于院内死亡率,模型基于相对于死亡或出院时间(结果依赖型)以及相对于入院时间(结果无关型)的数据进行训练与测试。
  • 对于低钾血症,评估了两种不同使用场景:(1) 以入院时间为参考,每12小时预测未来血钾水平;(2) 在每次实验室检查时进行按需预测,此时可获得真实标签。
  • 性能通过AUROC评估,测试集的构建方式反映真实世界部署条件。
  • 本研究对比了不同索引方案下的模型性能,强调结果无关型方案更能反映临床实用性,并避免测试数据中的选择性偏差。

实验结果

研究问题

  • RQ1时间索引策略的选择(结果依赖型 vs. 结果无关型)如何影响临床预测模型的性能?
  • RQ2在真实世界部署场景中,结果依赖型参考点在多大程度上导致性能估计过于乐观?
  • RQ3与结果依赖型索引相比,结果无关型索引是否能在ICU预测任务中生成更真实、性能更高的模型?
  • RQ4不同的预测时延与数据提取方案如何影响院内死亡率与低钾血症预测的模型性能?
  • RQ5使用有偏测试集(例如选择靠近临床事件的简单样本)对预测模型的临床实用性有何影响?

主要发现

  • 使用结果无关型参考点(如入院时间)进行模型评估时,院内死亡率的AUROC达到0.882,显著优于结果依赖型方法(AUROC 0.831)。
  • 在低钾血症预测中,结果无关型模型的AUROC为0.829,而结果依赖型模型仅为0.740,表明存在显著的性能差距。
  • 按需预测模型(在每次实验室检查时进行预测)的AUROC为0.738,尽管预测时延更短,但性能仍低于以入院时间为参考的模型,表明其难度更高,可能因选择性检测所致。
  • 基于结果依赖型参考点构建的测试集偏向于较简单的样本(如临近出院或临终的患者),导致性能指标被人为夸大,无法反映真实世界中的使用情况。
  • 使用结果依赖型索引进行训练与评估的模型,尽管可能对疾病机制提供一定见解,但由于性能被高估,无法可靠用于临床决策支持。
  • 本研究得出结论:在数据提取与评估方面,必须谨慎定义问题,以避免对模型临床价值的误判。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。