QUICK REVIEW
[论文解读] Predicting Severe Sepsis Using Text from the Electronic Health Record
Phil Culliton, Michael Levinson|arXiv (Cornell University)|Nov 30, 2017
Machine Learning in Healthcare参考文献 6被引用 14
一句话总结
本研究开发了一种机器学习模型,仅使用电子健康记录(EHR)中的非结构化文本,即可提前24小时预测严重脓毒症,AUC达到0.81。该模型在仅使用结构化数据时表现更优,且在结合文本与结构化数据后进一步提升性能,表明临床记录中包含未被数值字段捕捉的、具有高度预测性的专家标注信息。
ABSTRACT
Employing a machine learning approach we predict, up to 24 hours prior, a diagnosis of severe sepsis. Strongly predictive models are possible that use only text reports from the Electronic Health Record (EHR), and omit structured numerical data. Unstructured text alone gives slightly better performance than structured data alone, and the combination further improves performance. We also discuss advantages of using unstructured EHR text for modeling, as compared to structured EHR data.
研究动机与目标
- 调查仅使用非结构化EHR文本是否能够提前24小时预测严重脓毒症。
- 比较非结构化文本、结构化数据及其组合在严重脓毒症预测中的表现。
- 评估基于文本的模型在诊断前识别高风险患者方面的临床实用性。
- 评估在脓毒症预测建模中使用非结构化临床记录相较于结构化数据的优势。
提出的方法
- 对2012–2016年Baystate Health医院的203,000例住院EHR就诊记录进行回顾性分析。
- 采用结合8个结构化变量和ICD-10编码的改良临床标准定义严重脓毒症,并为每位患者精确定义‘严重脓毒症定义时间’。
- 通过在严重脓毒症定义时间前24小时内移除正样本的记录,并为负样本随机选择时间点,构建建模窗口。
- 将每位患者的全部非结构化记录(如进展记录、入院记录)合并为单个文本块用于建模。
- 应用基线‘词袋’分布式表示方法,将文本转换为机器学习可用的数值向量。
- 使用逻辑回归模型,结合交叉验证和2016年数据的时序外测试,进行训练与评估。
实验结果
研究问题
- RQ1是否可以仅使用非结构化EHR文本提前24小时预测严重脓毒症?
- RQ2非结构化文本的预测性能与仅使用结构化数据相比如何?
- RQ3结合非结构化与结构化EHR数据是否能将预测准确率提升至超过任一模态单独使用时的水平?
- RQ4在脓毒症预测建模中,使用非结构化临床记录相较于结构化数据具有哪些实际优势?
主要发现
- 仅使用非结构化文本的模型AUC达到0.81,略高于仅使用结构化数据的模型(AUC 0.80)。
- 结合非结构化与结构化数据的联合模型AUC达到0.85,较仅使用非结构化数据的模型提升5–10%。
- 在预测结果排名前1%的患者中(共136例,占13,603例),有125例在24小时内确诊为严重脓毒症。
- 该模型展现出实际的临床应用价值:在1,000例患者的队列中,前10%(136例)患者包含272例严重脓毒症病例,表明其具备强大的早期检测潜力。
- 非结构化记录中包含未被结构化数据捕捉的临床相关信息,例如对关键发现的选择性强调。
- 使用非结构化文本可减少人工预处理工作量,而结构化数据则需要进行聚合(如收缩压/舒张压的最大值/最小值)并处理缺失值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。