Skip to main content
QUICK REVIEW

[论文解读] Evaluating Progress on Machine Learning for Longitudinal Electronic Healthcare Data

David Bellamy, Leo Anthony Celi|arXiv (Cornell University)|Oct 2, 2020
Machine Learning in Healthcare参考文献 35被引用 14
一句话总结

本研究利用MIMIC-III数据集上的标准化基准,评估了纵向电子健康记录(EHRs)领域机器学习的进展,对比了178种模型在四个临床任务中的表现。尽管社区参与度高,但三年间性能提升微乎其微,深度学习模型仅在部分任务中优于逻辑回归,凸显了预测性能的停滞,以及在结构化医疗数据中亟需更对齐的基准。

ABSTRACT

The Large Scale Visual Recognition Challenge based on the well-known Imagenet dataset catalyzed an intense flurry of progress in computer vision. Benchmark tasks have propelled other sub-fields of machine learning forward at an equally impressive pace, but in healthcare it has primarily been image processing tasks, such as in dermatology and radiology, that have experienced similar benchmark-driven progress. In the present study, we performed a comprehensive review of benchmarks in medical machine learning for structured data, identifying one based on the Medical Information Mart for Intensive Care (MIMIC-III) that allows the first direct comparison of predictive performance and thus the evaluation of progress on four clinical prediction tasks: mortality, length of stay, phenotyping, and patient decompensation. We find that little meaningful progress has been made over a 3 year period on these tasks, despite significant community engagement. Through our meta-analysis, we find that the performance of deep recurrent models is only superior to logistic regression on certain tasks. We conclude with a synthesis of these results, possible explanations, and a list of desirable qualities for future benchmarks in medical machine learning.

研究动机与目标

  • 评估结构化纵向EHR数据机器学习的进展状态,重点关注预测性能随时间的变化。
  • 识别并分析一个共享基准,以实现基于相同实验设置开发的模型之间的直接比较。
  • 探究尽管关注度持续上升,为何临床预测任务(如死亡率、住院时长、表型识别、病情恶化)的进展仍保持停滞。
  • 评估模型架构、评估指标和任务定义对EHR机器学习中性能结果的影响。
  • 提出未来基准应具备的关键特性,以实现医疗机器学习中可靠、可复现且加速的进展。

提出的方法

  • 使用Web of Science对文献进行全面回顾,以识别结构化医疗数据的基准论文。
  • 聚焦Harutyunyan等人(2019年)提出的MIMIC-III基准,该基准提供标准化的训练/测试划分和一致的任务定义。
  • 汇总了20项研究中开发并评估的178种模型(包括基线模型)在相同实验设置下的结果。
  • 通过元分析比较不同时间、模型类型(如深度循环网络与逻辑回归)以及评估指标(AUROC、AUPRC)下的模型性能。
  • 评估任务定义差异(如30天与1年死亡率)、预处理步骤和评估指标选择对性能趋势的影响。
  • 使用开源实现以确保指标计算的一致性,避免因软件特定实现导致的差异。

实验结果

研究问题

  • RQ1在三年的时间跨度内,标准化EHR基准上的预测性能改善程度如何?
  • RQ2在结构化EHR数据的多个临床预测任务中,深度学习模型是否始终优于逻辑回归等传统方法?
  • RQ3任务定义差异(如30天与1年死亡率)和评估指标选择如何影响模型性能的可比性和解释性?
  • RQ4当前基准测试实践中的关键局限性是什么,导致其阻碍了结构化医疗数据机器学习的进展?
  • RQ5未来基准应具备哪些特性,才能实现临床预测建模中可靠、可复现且加速的进展?

主要发现

  • 在三年期间,MIMIC-III基准上四个临床任务(死亡率、住院时长、表型识别、患者病情恶化)的预测性能几乎没有实质改善。
  • 深度循环模型仅在特定任务(如患者病情恶化)中优于逻辑回归,而在死亡率或住院时长预测中则不然。
  • 大多数模型将AUROC作为主要评估指标,但对AUPRC等附加指标的使用不一致,限制了跨研究的可比性。
  • 研究未发现误差率趋近于下限的证据,表明由于死亡率等结果的“真实值”不断变化,贝叶斯误差可能不适合作为参考基准。
  • 缺乏标准化的任务定义(如死亡率预测的时间窗口不一致)可能是导致性能停滞和基准测试不一致的重要原因。
  • 尽管该基准获得190次引用,且178种模型在相同基准上被评估,但该领域仍未实现可衡量的进展,表明亟需更严格、对齐的基准测试实践。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。