Skip to main content
QUICK REVIEW

[论文解读] Deep Representation for Patient Visits from Electronic Health Records

Jean-Baptiste Escudié, Alaa Saade|arXiv (Cornell University)|Mar 26, 2018
Machine Learning in Healthcare参考文献 17被引用 6
一句话总结

本文提出一种监督深度学习方法,通过训练神经网络预测ICD-9诊断章节,从原始电子健康记录(EHR)数据——包括自由文本记录和结构化数据——中学习低维、临床上有意义的患者就诊嵌入表示。所得嵌入捕捉了相关的医学语义,提升了下游预测任务的性能(例如ICD编码),并在嵌入空间中揭示了可解释的临床方向,实现跨多种临床任务的复用而无需重新训练。

ABSTRACT

We show how to learn low-dimensional representations (embeddings) of patient visits from the corresponding electronic health record (EHR) where International Classification of Diseases (ICD) diagnosis codes are removed. We expect that these embeddings will be useful for the construction of predictive statistical models anticipated to drive personalized medicine and improve healthcare quality. These embeddings are learned using a deep neural network trained to predict ICD diagnosis categories. We show that our embeddings capture relevant clinical informations and can be used directly as input to standard machine learning algorithms like multi-output classifiers for ICD code prediction. We also show that important medical informations correspond to particular directions in our embedding space.

研究动机与目标

  • 使用包含结构化和自由文本组件的原始EHR数据,开发一种通用的、低维的患者就诊表示方法。
  • 利用ICD编码预测作为自监督任务,学习无手工特征工程的临床相关嵌入表示。
  • 证明所学嵌入能够保留医学语义,并提升下游预测任务的性能。
  • 实现这些嵌入在多种临床应用(如队列选择和疾病预测)中的复用,降低后续模型的计算成本。
  • 通过识别特定医学概念(例如败血症、抗生素耐药性)在嵌入空间中的方向性模式,提供可解释性。

提出的方法

  • 训练一个深度神经网络,从原始EHR输入中预测ICD-9诊断章节(19个大类),将此任务作为学习有意义表示的代理。
  • 模型输入包括结构化EHR数据(通过卡方特征选择从40,000个特征减少至8,000个)和自由文本临床记录(限制在2,000个词以内)。
  • 网络架构包含使用ReLU激活函数的全连接层,最终编码层生成ℝ⁴⁴⁸空间中的448维嵌入向量。
  • 训练目标为19个ICD-9章节的多分类交叉熵损失,使模型能够学习一种在各类诊断间具有泛化能力的共享表示。
  • 使用卡方检验自动完成特征选择,确保表示学习过程无需专家干预。
  • 通过已知临床概念(例如脓毒性休克、自身免疫共病)与嵌入空间中向量方向之间的共线性分析,评估嵌入的可解释性。

实验结果

研究问题

  • RQ1深度神经网络能否直接从原始EHR数据中学习到低维、临床上有意义的患者就诊表示,而无需手工特征工程?
  • RQ2将ICD-9诊断章节预测作为自监督任务,是否能生成捕捉相关医学语义并提升下游预测性能的嵌入表示?
  • RQ3特定临床概念(例如败血症、抗生素耐药性)是否在所学嵌入空间中以可解释的方向模式被编码?
  • RQ4是否可以有效复用同一预计算的嵌入表示于多个下游任务中,从而减少重新训练的需求?
  • RQ5与直接在标准机器学习模型中使用原始EHR特征相比,该嵌入表示的质量如何?

主要发现

  • 与直接使用原始EHR特征相比,所学的448维嵌入显著提升了随机森林分类器在ICD编码预测任务上的性能。
  • 通过共线性分析表明,尽管输入特征中未显式编码,嵌入仍能捕捉到如脓毒性或心源性休克等复杂临床概念。
  • 即使在结构化EHR数据中缺失,自身免疫共病仍可在嵌入空间中被恢复,表明对数据稀疏性的鲁棒性。
  • 该模型成功地在19个ICD-9大类诊断章节内组织了更精细的诊断概念,证明尽管存在类别不平衡,该表示仍编码了细微的临床语义。
  • 嵌入空间揭示了与关键医学概念相对应的可解释方向,验证了其临床相关性和可解释性。
  • 预计算嵌入表示可实现高效复用于多个下游任务,显著降低后续模型的计算成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。