Skip to main content
QUICK REVIEW

[论文解读] Learning Representations of Missing Data for Predicting Patient Outcomes

Brandon Malone, Alberto García-Durán|arXiv (Cornell University)|Nov 12, 2018
Machine Learning in Healthcare参考文献 21被引用 7
一句话总结

本文提出了一种基于图的表示学习方法 EP-md,通过为观测到的数据模态和缺失数据模态分别学习独立嵌入,显式建模电子健康记录(EHRs)中的缺失数据。通过在患者亲和图上传播信息,该方法能够传播关于缺失特征的知识,从而提升对住院死亡率、住院时长和出院去向的预测性能。在使用多模态数据(时间序列、文本、人口统计学信息)时,其表现优于当前最先进模型。

ABSTRACT

Extracting actionable insight from Electronic Health Records (EHRs) poses several challenges for traditional machine learning approaches. Patients are often missing data relative to each other; the data comes in a variety of modalities, such as multivariate time series, free text, and categorical demographic information; important relationships among patients can be difficult to detect; and many others. In this work, we propose a novel approach to address these first three challenges using a representation learning scheme based on message passing. We show that our proposed approach is competitive with or outperforms the state of the art for predicting in-hospital mortality (binary classification), the length of hospital visits (regression) and the discharge destination (multiclass classification).

研究动机与目标

  • 解决电子健康记录(EHRs)中缺失和不完整数据带来的挑战,这些挑战阻碍了传统机器学习方法的应用。
  • 在统一的表示学习框架中建模多种数据模态,如时间序列、自由文本和人口统计学数据。
  • 通过在患者相似性图上传播的可学习嵌入,显式表示缺失数据,从而提升预测性能。
  • 在关键临床预测任务(住院死亡率、住院时长、出院去向)上展示性能提升。
  • 通过识别对模型预测最具影响力的特征,实现可解释性,即使这些特征缺失。

提出的方法

  • 将嵌入传播(EP)这一无监督图表示学习方法扩展,通过每种模态的双重表示来建模观测到的数据和缺失的数据。
  • 基于临床相似性构建患者亲和图,其中边连接具有相似属性或诊断的患者。
  • 使用重构损失训练模态特定的嵌入,即使部分患者缺少数据,也能实现表示学习。
  • 为每个患者每种模态学习两种表示:一种用于观测数据,一种用于缺失数据,两者均通过消息传递从邻近患者获取信息。
  • 将模态特定的嵌入整合为统一的患者表示,用于下游预测任务。
  • 在 MIMIC-III 基准数据集上应用该模型,整合时间序列、医师记录(文本)和人口统计学数据,实现多模态学习。

实验结果

研究问题

  • RQ1基于图的表示学习框架能否通过为缺失性显式学习嵌入,有效建模 EHR 中的缺失数据?
  • RQ2将缺失数据建模为可学习表示,能否提升临床结局预测的性能?
  • RQ3在结合缺失数据建模时,引入多种数据模态(时间序列、文本、人口统计学)是否能增强预测性能?
  • RQ4学习到的表示在多大程度上捕捉了缺失特征对预测的影响,尤其是当这些特征未被观测到时?
  • RQ5即使某些临床特征缺失,该模型能否识别出对预测最具影响力的特征?

主要发现

  • 在使用多模态数据(时间序列、文本、人口统计学)时,EP-md 在预测住院时长和出院去向方面优于当前最先进模型。
  • 在仅使用时间序列数据时,EP-md 在住院死亡率预测任务上与长短期记忆网络(LSTM)性能相当。
  • 在住院时长预测任务中,当仅使用 100 个标注样本进行训练时,该模型相比原始特征将平均绝对误差(MAE)降低了最多 15%。
  • 与基线模型相比,该模型在缺失特征患者中的预测更准确,表现为观测与缺失情况下的 MAE 差异为负值。
  • 体温和 pH 是住院时长预测中最具影响力的特征,无论其是否被观测,其贡献均保持一致,表明对缺失数据的信息传播有效。
  • 格拉斯哥昏迷评分特征在缺失时贡献较小,凸显了模型反映未观测临床指标预测能力下降的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。