Skip to main content
QUICK REVIEW

[论文解读] Multi-layer Representation Learning for Medical Concepts

Edward Choi, Mohammad Taha Bahadori|arXiv (Cornell University)|Feb 17, 2016
Topic Modeling参考文献 34被引用 10
一句话总结

本文提出 Med2Vec,一种两层神经网络,通过利用就诊内共现模式和就诊间序列模式,从电子健康记录(EHR)数据中学习可解释的、低维的医疗编码和患者就诊表示。在预测任务中,其性能优于 Skip-gram、GloVe 和堆叠自编码器等基线模型,且通过专家验证实现了临床意义明确的可解释性。

ABSTRACT

Learning efficient representations for concepts has been proven to be an important basis for many applications such as machine translation or document classification. Proper representations of medical concepts such as diagnosis, medication, procedure codes and visits will have broad applications in healthcare analytics. However, in Electronic Health Records (EHR) the visit sequences of patients include multiple concepts (diagnosis, procedure, and medication codes) per visit. This structure provides two types of relational information, namely sequential order of visits and co-occurrence of the codes within each visit. In this work, we propose Med2Vec, which not only learns distributed representations for both medical codes and visits from a large EHR dataset with over 3 million visits, but also allows us to interpret the learned representations confirmed positively by clinical experts. In the experiments, Med2Vec displays significant improvement in key medical applications compared to popular baselines such as Skip-gram, GloVe and stacked autoencoder, while providing clinically meaningful interpretation.

研究动机与目标

  • 解决从高维 EHR 数据中学习高效、可扩展且可解释的医疗概念表示的挑战。
  • 建模患者就诊记录中医疗编码的就诊内共现关系与就诊间的时间序列关系。
  • 开发一种无需专家医学知识或监督信号的表示学习方法,同时获得临床可解释的结果。
  • 在真实医疗应用中展示其在可扩展性和性能方面相对于 Skip-gram、GloVe 和堆叠自编码器等基线模型的改进。
  • 通过临床专家用户研究验证所学表示的可解释性。

提出的方法

  • Med2Vec 使用两层神经网络架构:第一层从就诊内的共现模式中学习编码级别表示,第二层从就诊顺序的序列关系中学习就诊级别表示。
  • 采用改进的 Skip-gram 目标函数,以同时建模就诊内的编码共现关系和就诊间的序列关系。
  • 通过负采样提升在包含数百万次就诊的大规模 EHR 数据集上的训练效率和可扩展性。
  • 将每次就诊视为一个“句子”,就诊内医疗编码视为上下文窗口中的“词”,从而学习就诊级别表示。
  • 通过逻辑回归和特征重要性分析,分析每个就诊表示中贡献最大的编码坐标,实现可解释性。
  • 临床专家通过将所学向量坐标与临床相关的疾病聚类进行关联,验证其可解释性。

实验结果

研究问题

  • RQ1多层表示学习框架能否有效捕捉 EHR 数据中的共现关系与序列关系,从而改善医疗概念表示?
  • RQ2与现有基线相比,Med2Vec 是否不仅产生更准确的表示,而且具备临床可解释性?
  • RQ3所学的编码与就诊表示在多大程度上能提升真实医疗预测任务的性能?
  • RQ4哪些特定的医疗编码聚类最能预测临床结局(如 CRG 等级),且能否实现有意义的临床解释?
  • RQ5该模型能否在包含超过 300 万次就诊和数万个医疗编码的大规模 EHR 数据集上实现有效扩展?

主要发现

  • Med2Vec 在预测临床风险组(CRG)方面显著优于 Skip-gram、GloVe 和堆叠自编码器,展现出更优的表示质量。
  • 该模型具备高度可扩展性,成功在两个大规模数据集(分别包含 300 万和 550 万次就诊)上学习表示。
  • 临床专家确认,所学嵌入空间中贡献最大的编码坐标对应于临床有意义的疾病聚类,如镰状细胞病、癫痫和先天性染色体异常。
  • 与先天性染色体异常相关的编码坐标 190 和与先天性瘫痪相关的编码坐标 199 被确定为高 CRG 水平最强预测因子,与临床直觉一致。
  • 就诊坐标 50 在镰状细胞病患者和运动相关损伤患者中表现出强烈激活,而就诊坐标 41 与脑损伤和癫痫患者相关,证实了其临床相关性。
  • 通过临床专家用户研究验证了模型的可解释性,专家确认所学表示反映了现实世界中的临床关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。