Skip to main content
QUICK REVIEW

[论文解读] Early Prediction of Acute Kidney Injury in Critical Care Setting Using Clinical Notes

Yikuan Li, Liang Yao|arXiv (Cornell University)|Nov 7, 2018
Machine Learning in Healthcare参考文献 10被引用 13
一句话总结

本研究开发了一种基于自然语言处理(NLP)的机器学习模型,利用患者入院后前24小时内的临床记录,预测其在重症监护病房(ICU)入院后72小时内发生急性肾损伤(AKI)的可能。通过使用MetaMap和UMLS提取具有临床意义的词与概念特征,并应用监督分类器,该模型取得了0.779的AUC,表明对非结构化临床记录进行NLP分析可实现对一般危重症患者早期AKI风险的预测。

ABSTRACT

Acute kidney injury (AKI) in critically ill patients is associated with significant morbidity and mortality. Development of novel methods to identify patients with AKI earlier will allow for testing of novel strategies to prevent or reduce the complications of AKI. We developed data-driven prediction models to estimate the risk of new AKI onset. We generated models from clinical notes within the first 24 hours following intensive care unit (ICU) admission extracted from Medical Information Mart for Intensive Care III (MIMIC-III). From the clinical notes, we generated clinically meaningful word and concept representations and embeddings, respectively. Five supervised learning classifiers and knowledge-guided deep learning architecture were used to construct prediction models. The best configuration yielded a competitive AUC of 0.779. Our work suggests that natural language processing of clinical notes can be applied to assist clinicians in identifying the risk of incident AKI onset in critically ill patients upon admission to the ICU.

研究动机与目标

  • 开发一种基于数据驱动的方法,利用非结构化临床记录对危重症患者中的急性肾损伤(AKI)进行早期预测。
  • 探究对临床记录进行自然语言处理是否能超越传统生物标志物,提升AKI早期风险预测的准确性。
  • 评估多种机器学习分类器及知识引导的深度学习模型在临床记录上进行AKI预测的性能表现。
  • 从临床记录中识别与AKI发生相关的具有临床意义的特征。
  • 评估利用NLP支持临床决策的可行性,通过早期识别高风险患者以辅助危重症护理。

提出的方法

  • 从MIMIC-III数据库中提取18岁及以上患者入院后前24小时内的临床记录。
  • 文本预处理包括隐私信息去除(PHI masking)、Porter词干还原,以及去除文档频率低于100的低频词和313个停用词。
  • 生成两种特征表示:基于词袋(unigram)模型和通过MetaMap提取的UMLS概念唯一标识符(CUIs)的词袋模型。
  • 在特征集上训练五种监督学习分类器(逻辑回归、SVM、随机森林、XGBoost、lightGBM)以及一种知识引导的卷积神经网络(CNN)。
  • 表现最佳的模型为在组合的词袋与CUI词袋特征上使用L2正则化的逻辑回归,AUC达到0.779。
  • 通过7:3的训练集与测试集划分评估模型性能,并采用患者级数据分离以防止数据泄露。

实验结果

研究问题

  • RQ1能否利用ICU入院后前24小时内临床记录的自然语言处理,在72小时内实现对AKI发生的临床可用预测准确率?
  • RQ2从NLP中提取的哪些特征(词语或医学概念)最能预测危重症患者中AKI的发生?
  • RQ3在使用临床记录进行AKI预测时,不同机器学习分类器的性能表现如何比较?
  • RQ4知识引导的深度学习架构是否能在该临床NLP任务中超越传统分类器,提升预测准确率?
  • RQ5模型识别出的与未来AKI发生最相关的临床术语和概念是什么?

主要发现

  • 表现最佳的模型采用在组合的词袋与CUI词袋特征上使用L2正则化的逻辑回归,对AKI发生的预测AUC达到0.779。
  • 临床相关性高的术语如'cabg'、'lasix'、'swan'和'insulin'在模型中被识别为高权重特征,表明其具有强预测相关性。
  • 术语'urosepsis'在记录中出现频率较低(11,560份记录中仅79次),但与AKI高度相关,提示术语映射可进一步优化。
  • 错误分析显示,高风险术后患者(如冠状动脉旁路移植术后)有时被过度预测,原因在于频繁提及高系数术语,即使未发生AKI。
  • 知识引导的CNN未超越传统分类器,可能由于临床记录文本较长且数据集规模较小。
  • 特征分析证实,模型捕捉到了具有临床相关性的信号,例如'CUI'(中央核心肌病)和'rhabdomyolysis'(横纹肌溶解),这些均为已知的AKI危险因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。