Skip to main content
QUICK REVIEW

[论文解读] Predicting readmission risk from doctors' notes

Erin Craig, C. A. A. Arias|arXiv (Cornell University)|Nov 29, 2017
Machine Learning in Healthcare参考文献 15被引用 8
一句话总结

本研究利用自然语言处理技术对未结构化的医生出院记录进行深度学习建模,以预测30天内全院范围内的非计划再入院,曲线下面积(AUC)达到0.70。该模型通过将预测结果与病历中的具体短语关联,实现了可解释性,使临床医生能够理解哪些临床特征驱动了风险预测。

ABSTRACT

We develop a model using deep learning techniques and natural language processing on unstructured text from medical records to predict hospital-wide $30$-day unplanned readmission, with c-statistic $.70$. Our model is constructed to allow physicians to interpret the significant features for prediction.

研究动机与目标

  • 利用医生出院记录中的非结构化文本预测30天内全院范围内的非计划再入院。
  • 开发一种保持可解释性的深度学习模型,使临床医生能够理解驱动预测结果的特征。
  • 从非结构化的病历文本中提取临床有意义的信号,如预后判断、持续存在的疾病状态以及治疗结局,这些信息在结构化电子病历(EMR)数据中未被记录。
  • 通过理解临床病历中的自然语言,超越传统风险评分(如LACE评分)实现对高风险患者的更早识别。
  • 证明未结构化的临床文本中包含可被有效且有意义提取的预测信号,且可通过浅层、可解释的神经网络架构实现。

提出的方法

  • 通过移除姓名、数字、日期和标点符号对出院记录进行预处理,以减少偏差和过拟合。
  • 利用人工识别的章节标题模式匹配,将病历分段为标准化部分(如过敏史、预后评估、出院时状况等)。
  • 通过截断较长的病历和用'PADDING'标记填充较短的病历,将所有病历标准化为700个词的长度。
  • 采用一维卷积神经网络(1D-CNN),并使用预训练的skip-gram word2vec模型初始化词嵌入。
  • 对三元组级别特征使用最大池化,且每个池化节点均直接关联输入文本中的特定短语,以实现可解释性。
  • 使用Keras框架、TensorFlow后端和RMSprop优化器进行模型训练,并采用类似注意力机制的权重分配方式,识别对预测影响最大的短语。

实验结果

研究问题

  • RQ1能否利用医生出院记录中的非结构化文本,实现具有临床意义的性能,以预测30天内全院范围内的非计划再入院?
  • RQ2在临床病历上训练的深度学习模型,其预测性能是否可与或优于传统风险评分(如LACE评分)相当?
  • RQ3在多大程度上可使神经网络模型具备可解释性,从而使临床医生能够理解影响其预测结果的具体短语?
  • RQ4哪些类型的临床信息(如预后判断、持续存在的疾病状态、治疗结局等)在模型学习到的特征中最具预测性且可识别?
  • RQ5与人口统计学信息、共病情况和既往就诊记录等结构化数据相比,纳入叙述性文本在多大程度上提升了风险预测能力?

主要发现

  • 1D-CNN模型在测试数据上对30天内全院范围非计划再入院的预测曲线下面积(c-statistic)达到0.70,优于基于LACE特征的逻辑回归模型(c-statistic: 0.66)。
  • 当将该模型与LACE特征结合时,其预测性能仍保持在0.70,表明叙述性文本提供了独立于结构化风险评分的预测价值。
  • 该模型成功识别出临床相关的特征,如医生对不良预后的判断、持续存在的疾病状态、已实施的治疗操作以及药物类别。
  • 通过将每个最大池化节点与出院记录中的特定三元组短语关联,实现了可解释性,使临床医生能够追溯预测结果到实际的临床语言表达。
  • 该模型检测到在结构化EMR数据中未记录的特征,如主观临床判断和未记录的持续疾病状态,证明了叙述性文本的独特价值。
  • 尽管存在局限性,但该模型的性能表明,叙述性临床病历中包含强大且可操作的再入院风险预测信号,可通过可解释的深度学习方法有效提取。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。