[论文解读] Application of Clinical Concept Embeddings for Heart Failure Prediction in UK EHR data
本研究将基于GloVe的临床概念嵌入应用于英国电子健康记录(EHR),以预测心力衰竭风险,表明诊断和操作的低维表示相较于独热编码能提升预测性能。该方法在结合主要和次要诊断及操作时,实现了0.6965的AUROC,显示出在异构数据源中的微小增益和稳健性。
Electronic health records (EHR) are increasingly being used for constructing disease risk prediction models. Feature engineering in EHR data however is challenging due to their highly dimensional and heterogeneous nature. Low-dimensional representations of EHR data can potentially mitigate these challenges. In this paper, we use global vectors (GloVe) to learn word embeddings for diagnoses and procedures recorded using 13 million ontology terms across 2.7 million hospitalisations in national UK EHR. We demonstrate the utility of these embeddings by evaluating their performance in identifying patients which are at higher risk of being hospitalised for congestive heart failure. Our findings indicate that embeddings can enable the creation of robust EHR-derived disease risk prediction models and address some the limitations associated with manual clinical feature engineering.
研究动机与目标
- 开发并评估从英国EHR数据中提取的低维临床概念嵌入在心力衰竭风险预测中的应用。
- 评估嵌入是否能减少在高度维度化和异构的EHR数据中对手动特征工程的依赖。
- 在大型、多提供方的英国EHR数据集中,对比嵌入与传统独热编码的预测性能。
- 研究不同临床数据组成部分(如主要与次要诊断、操作)对模型性能的影响。
提出的方法
- 在英国生物银行EHR数据中270万次住院记录的1300万个本体术语上训练GloVe词嵌入。
- 构建了四个不同的语料库:主要诊断(PRIMDX)、主要诊断+操作(PRIMDX-PROC)、主要+次要诊断(PRIMDX-SECDX),以及三者结合(PRIMDX-SECDX-PROC)。
- 通过患者EHR中所有临床概念嵌入的平均值,将单个患者记录转换为密集向量表示。
- 使用5折交叉验证,在患者级嵌入上训练线性SVM分类器,并通过网格搜索调整超参数。
- 使用AUROC和加权F1分数在保留的测试集上评估模型性能,评估不同向量尺寸和上下文窗口尺寸下的表现。
- 使用t-SNE可视化学习到的嵌入空间中临床概念之间的语义关系。
实验结果
研究问题
- RQ1基于GloVe的临床概念嵌入能否有效表示异构的英国EHR数据,以实现心力衰竭风险预测?
- RQ2在英国EHR数据中,基于嵌入的模型与传统独热编码模型相比,其预测性能如何?
- RQ3哪些临床数据组合(如主要与次要诊断、操作)能带来最高的预测性能?
- RQ4与单一来源研究相比,使用嵌入是否能提升模型在多样化、多提供方EHR来源中的稳健性?
主要发现
- 使用临床概念嵌入的最佳模型在结合主要和次要诊断与操作时,实现了0.6965的AUROC和0.7500的F1分数。
- 嵌入方法略优于独热编码,其中PRIMDX-SECDX-PROC模型表现出最高的AUROC(0.6965)和F1(0.7500)。
- 尽管在最佳独立配置下PRIMDX表现略优,但基于PRIMDX-SECDX-PROC训练的模型始终优于仅基于PRIMDX的模型。
- 嵌入空间捕捉到了有意义的语义关系,I50(心力衰竭)与生物相关术语如I25(慢性缺血性心脏病)和I21(急性心肌梗死)在空间中邻近。
- 对于内容不那么全面的语料库,较小的向量尺寸(50D)和较大的上下文窗口(10–20)表现最优;而对于完整语料库,较大的向量(250D)和较小的窗口(5)效果最佳。
- 性能与先前使用类似方法的美国研究相当,表明嵌入在不同医疗系统和数据源中具有稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。