Skip to main content
QUICK REVIEW

[论文解读] Yet Another ICU Benchmark: A Flexible Multi-Center Framework for Clinical ML

Robin van de Water, H.A.E. Schmidt|arXiv (Cornell University)|Jun 8, 2023
Machine Learning in Healthcare被引用 7
一句话总结

本文介绍了 Yet Another ICU Benchmark (YAIB),这是一个模块化、开源的框架,可对多个 ICU 数据集(MIMIC-III/IV、eICU、HiRID、AUMCdb)实现临床机器学习工作流程的标准化,从而实现可复现且可比较的模型开发。结果表明,数据预处理和队列定义对模型性能的影响远大于模型架构,凸显了在临床机器学习领域实施统一基准测试的迫切需求。

ABSTRACT

Medical applications of machine learning (ML) have experienced a surge in popularity in recent years. The intensive care unit (ICU) is a natural habitat for ML given the abundance of available data from electronic health records. Models have been proposed to address numerous ICU prediction tasks like the early detection of complications. While authors frequently report state-of-the-art performance, it is challenging to verify claims of superiority. Datasets and code are not always published, and cohort definitions, preprocessing pipelines, and training setups are difficult to reproduce. This work introduces Yet Another ICU Benchmark (YAIB), a modular framework that allows researchers to define reproducible and comparable clinical ML experiments; we offer an end-to-end solution from cohort definition to model evaluation. The framework natively supports most open-access ICU datasets (MIMIC III/IV, eICU, HiRID, AUMCdb) and is easily adaptable to future ICU datasets. Combined with a transparent preprocessing pipeline and extensible training code for multiple ML and deep learning models, YAIB enables unified model development. Our benchmark comes with five predefined established prediction tasks (mortality, acute kidney injury, sepsis, kidney function, and length of stay) developed in collaboration with clinicians. Adding further tasks is straightforward by design. Using YAIB, we demonstrate that the choice of dataset, cohort definition, and preprocessing have a major impact on the prediction performance - often more so than model class - indicating an urgent need for YAIB as a holistic benchmarking tool. We provide our work to the clinical ML community to accelerate method development and enable real-world clinical implementations. Software Repository: https://github.com/rvandewater/YAIB.

研究动机与目标

  • 为解决由于数据集使用不一致、队列定义和预处理流程差异,导致 ICU 机器学习研究缺乏可复现性和可比性的问题。
  • 提供一个模块化、可扩展的框架,对多个公开的 ICU 数据集实现从队列定义到模型评估的整个机器学习流程的标准化。
  • 使研究人员能够以统一、透明且可比较的方式开发、训练和评估模型,从而减少方法论上的负担。
  • 证明数据相关选择(如队列、预处理)对模型性能的影响大于模型架构,强调需要采用整体性基准测试。
  • 通过提供预定义临床任务和开源代码的共享、社区就绪的基准,加速临床机器学习在真实世界中的实施。

提出的方法

  • YAIB 是一个模块化框架,支持多个公开的 ICU 数据集(MIMIC-III/IV、eICU、HiRID、AUMCdb),在时间尺度、单位和临床定义方面实现标准化的数据整合。
  • 它提供了一个透明的端到端流程,涵盖队列定义、特征工程、预处理、模型训练和评估,支持传统机器学习和深度学习模型。
  • 该框架包含五个预定义的临床预测任务:ICU 死亡率、急性肾损伤(AKI)、败血症、肾功能(KF)和住院时长(LoS),由临床医生协作开发。
  • 通过交叉验证支持超参数调优,并提供预训练模型、可复现的代码和详细的文档,确保完全透明。
  • 该框架具有可扩展性:通过极少的代码修改即可添加新数据集和任务,并与现有机器学习库(如 LightGBM、PyTorch)集成。
  • 所有组件均已开源,包含依赖项说明、训练/评估脚本以及符合机器学习最佳实践的可复现性检查清单。

实验结果

研究问题

  • RQ1队列定义、预处理和数据集选择的差异如何影响 ICU 预测模型的性能?
  • RQ2与模型架构相比,数据相关选择(如特征选择、缺失值填补、时间窗口划分)在多大程度上影响模型性能?
  • RQ3统一的、模块化的基准框架能否提升多中心 ICU 机器学习研究中的可复现性和可比性?
  • RQ4在使用标准化流程时,最先进模型在不同 ICU 数据集上的性能表现如何变化?
  • RQ5共享的基准框架能否加速临床机器学习模型的开发和真实世界部署?

主要发现

  • 数据集选择、队列定义和预处理流程对模型性能的影响大于模型架构的选择,表明数据相关决策是性能差异的主要驱动因素。
  • 在相同的标准化流程下评估时,即使针对同一临床任务,模型性能在不同数据集间仍存在显著差异,凸显了统一基准测试的重要性。
  • 该框架成功实现了在五个主要 ICU 数据集上的一致模型训练与评估,结果可复现,且超参数调优过程透明。
  • 所有五个基准任务(死亡率、AKI、败血症、KF、LoS)的预训练模型均已公开提供,降低了新研究者参与的门槛。
  • 统一流程的使用减少了方法论噪声,使得跨研究和机构的模型性能比较更加可靠。
  • 该框架的模块化和可扩展性使其能够无缝集成新数据集和新任务,支持临床机器学习未来基准测试的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。