[论文解读] Generalizability of predictive models for intensive care unit patients
本研究利用eICU-CRD评估了重症监护病房患者死亡率预测模型的泛化能力,表明在多个医院间联合训练的单一模型在区分度(AUROC = 0.849)方面优于仅使用有限本地数据重新训练的本地模型,且跨中心交叉验证可提供外部性能的可靠估计,凸显了多中心数据共享在构建高性能临床模型中的价值。
A large volume of research has considered the creation of predictive models for clinical data; however, much existing literature reports results using only a single source of data. In this work, we evaluate the performance of models trained on the publicly-available eICU Collaborative Research Database. We show that cross-validation using many distinct centers provides a reasonable estimate of model performance in new centers. We further show that a single model trained across centers transfers well to distinct hospitals, even compared to a model retrained using hospital-specific data. Our results motivate the use of multi-center datasets for model development and highlight the need for data sharing among hospitals to maximize model performance.
研究动机与目标
- 评估在多中心ICU数据上训练的预测模型在新出现的、未见过的医院中的泛化能力。
- 评估在多个ICU数据合并后训练的模型是否优于仅使用本地医院数据重新训练的模型。
- 调查在多个中心之间进行交叉验证是否能提供外部环境中模型性能的可靠估计。
- 检查在本地医院环境中,校准与样本量对模型校准和区分度的影响。
- 倡导医院间的数据共享,以提升危重症护理中预测模型的性能。
提出的方法
- 在eICU-CRD v2.0数据库中来自46家美国医院的50,106例ICU住院记录上,使用L2正则化的逻辑回归模型进行训练。
- 从ICU入院起固定24小时窗口内提取82个特征,包括人口统计学信息、生命体征和实验室数值,排除与治疗相关的变量。
- 使用AUROC评估区分度,使用SMR评估校准性能,评估对象为保留的医院。
- 在训练集中进行5折交叉验证,以估计模型的泛化性能。
- 在一家大型医院(医院73)进行校准实验,逐步增加本地训练集规模(从200例增至2,400例),比较迁移模型与本地训练模型的性能。
- 将校准实验重复50次并进行随机洗牌,以确保性能估计的稳定性。
实验结果
研究问题
- RQ1在多中心ICU数据上训练的模型是否能很好地泛化到新的、未见过的医院?
- RQ2随着本地数据集规模的增加,迁移模型的性能与本地重新训练模型相比如何?
- RQ3在多个中心之间进行交叉验证是否能提供外部医院中模型性能的可靠估计?
- RQ4在本地医院环境中,校准对模型校准和区分度有何影响?
- RQ5医院间的数据共享在多大程度上能提升ICU死亡率预测中预测模型的性能?
主要发现
- 多中心模型在交叉验证中的AUROC为0.854,其在保留医院中的AUROC稳定在0.849,表明具有较强的泛化能力。
- 多中心模型在外部医院的SMR范围为0.560至1.43,平均值为0.998,表明其平均校准性能良好。
- 本地模型最初存在过度预测(SMR > 1.0),但随着数据量增加而改善,最终SMR接近1.0。
- 尽管随着数据增加而改善,本地模型的AUROC(2,400例患者后为0.796)仍低于迁移模型的AUROC(0.849)。
- 迁移模型在各医院间的表现一致,未观察到系统性性能下降,尽管性能存在显著差异。
- 结果表明,即使经过校准,医院间数据的整合仍优于孤立的本地模型开发,能获得更优的模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。