Skip to main content
QUICK REVIEW

[论文解读] Predicting Patient Outcomes with Graph Representation Learning

Emma Rocheteau, Catherine Tong|arXiv (Cornell University)|Jan 11, 2021
Machine Learning in Healthcare被引用 5
一句话总结

该论文提出LSTM-GNN模型,结合长短期记忆网络(LSTM)处理时间生理特征与图神经网络(GNN)通过诊断信息建模患者相似性,在eICU数据集上显著提升了住院时长预测性能。基于图的方法通过邻域信息捕捉罕见疾病模式,性能优于标准LSTM基线模型,并在诊断编码方面展现出互补优势。

ABSTRACT

Recent work on predicting patient outcomes in the Intensive Care Unit (ICU) has focused heavily on the physiological time series data, largely ignoring sparse data such as diagnoses and medications. When they are included, they are usually concatenated in the late stages of a model, which may struggle to learn from rarer disease patterns. Instead, we propose a strategy to exploit diagnoses as relational information by connecting similar patients in a graph. To this end, we propose LSTM-GNN for patient outcome prediction tasks: a hybrid model combining Long Short-Term Memory networks (LSTMs) for extracting temporal features and Graph Neural Networks (GNNs) for extracting the patient neighbourhood information. We demonstrate that LSTM-GNNs outperform the LSTM-only baseline on length of stay prediction tasks on the eICU database. More generally, our results indicate that exploiting information from neighbouring patient cases using graph neural networks is a promising research direction, yielding tangible returns in supervised learning performance on Electronic Health Records.

研究动机与目标

  • 解决现有模型在利用稀疏、高维电子健康记录(EHR)数据(如诊断和药物)方面的局限性。
  • 通过整合患者之间的关系信息,改进院内死亡率(IHM)和ICU住院时长(LOS)的预测。
  • 探究基于图的患者相似性建模是否能提升标准编码器所忽略的罕见共病模式的预测性能。
  • 开发一个端到端、可解释的模型,结合时间建模与基于图的邻域信息。

提出的方法

  • 构建一个静态患者图,其中节点代表患者,边代表诊断向量之间的相似性,采用k近邻方法。
  • 使用单向LSTM处理时间生理时间序列,从ICU住院前24小时提取序列模式。
  • 在患者图上应用四种GNN架构——GCN、GAT、GraphSAGE和MPNN,聚合邻域信息并优化患者表征。
  • 将LSTM编码的时间特征与GNN编码的患者表征拼接,并通过全连接层进行最终预测。
  • 使用诊断编码器单独嵌入诊断特征,并对比有无该组件的性能,以评估其贡献。
  • 利用GAT中的注意力权重解释模型决策,可视化对预测影响最大的相似患者。

实验结果

研究问题

  • RQ1与仅使用LSTM的标准模型相比,通过共享诊断构建的患者相似性图是否能提升结局预测性能?
  • RQ2基于图的方法在处理EHR数据中罕见共病模式方面,与传统诊断编码相比表现如何?
  • RQ3结合时间建模(LSTM)与基于图的邻域信息,是否优于单独使用任一组件?
  • RQ4图表示在住院时长预测与院内死亡率预测中,分别提升了多少性能?
  • RQ5GNN中的注意力机制能否提供可解释的洞察,识别出影响模型预测的关键相似患者?

主要发现

  • LSTM-GNN模型在住院时长预测上优于仅使用LSTM的基线模型,使用GAT时AUC达0.854 ± 0.001,使用SAGE时为0.851 ± 0.003。
  • 仅图组件(LSTM-GNN*)在住院时长预测上显著优于仅LSTM(LSTM*),表明基于诊断的患者相似性是一种有价值的信号。
  • LSTM-GNN联合模型表现最佳,LOS的平均绝对误差为1.86,IHM的AUC为0.371,表明时间建模与关系建模之间存在协同效应。
  • 诊断编码器对院内死亡率预测的贡献更大,而图组件在住院时长预测中带来更大提升,表明其收益具有任务依赖性。
  • LSTM-GAT中的注意力权重能正确识别出临床相关的邻近患者(如具有类似罕见疾病如充血性心力衰竭的患者),验证了模型的可解释性。
  • 消融研究证实,若移除LSTM组件,性能显著下降,凸显了对时间序列数据进行序列建模的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。