Skip to main content
QUICK REVIEW

[论文解读] Enhancing Model Interpretability and Accuracy for Disease Progression Prediction via Phenotype-Based Patient Similarity Learning

Yue Wang, Tong Wu|arXiv (Cornell University)|Sep 26, 2019
Machine Learning in Healthcare参考文献 14被引用 5
一句话总结

该论文提出了一种基于表型的患者相似性学习方法,利用纵向电子健康记录(EHR)中的非负矩阵分解(NMF)来改善疾病进展预测。通过从聚合的患者-服务矩阵中提取临床上有意义的表型,该方法提升了模型的可解释性与准确性,在包括Wide & Deep、逻辑回归和卷积神经网络(CNN)在内的多种模型中,加入表型特征后,PR-AUC均实现了2%以上的稳定提升。

ABSTRACT

Models have been proposed to extract temporal patterns from longitudinal electronic health records (EHR) for clinical predictive models. However, the common relations among patients (e.g., receiving the same medical treatments) were rarely considered. In this paper, we propose to learn patient similarity features as phenotypes from the aggregated patient-medical service matrix using non-negative matrix factorization. On real-world medical claim data, we show that the learned phenotypes are coherent within each group, and also explanatory and indicative of targeted diseases. We conducted experiments to predict the diagnoses for Chronic Lymphocytic Leukemia (CLL) patients. Results show that the phenotype-based similarity features can improve prediction over multiple baselines, including logistic regression, random forest, convolutional neural network, and more.

研究动机与目标

  • 为应对异质性疾病进展模式的挑战,基于共享的医疗服务模式识别具有临床意义的患者亚群。
  • 解决常规医疗服务在患者相似性计算中掩盖罕见但具有临床意义服务的问题。
  • 通过从EHR数据中学习代表一致、生物学上合理的临床特征的表型,提升模型可解释性。
  • 通过将基于表型的相似性特征与序列化EHR建模相结合,提升疾病进展预测模型的准确性。
  • 证明表型特征在多种机器学习架构(包括Wide & Deep、CNN和树基模型)中的泛化能力。

提出的方法

  • 对聚合的患者-服务矩阵应用非负矩阵分解(NMF),以学习代表相关医疗服务群组的潜在表型。
  • 将患者就诊路径按周分箱,汇总随时间推移的服务次数,形成患者层面的向量,进而构建患者-服务矩阵。
  • 表型特征作为NMF基矩阵导出,其中每一列代表一个表型——即共同出现的临床服务聚类。
  • 通过修改后的Wide & Deep神经网络,将序列化EHR数据(通过深度塔中的LSTM处理)与非序列化特征(人口统计学信息和NMF表型)联合集成,实现在宽塔中的联合预测。
  • 使用Adam优化器进行训练,并结合早停策略;性能通过不同敏感度阈值下的PR-AUC和F1分数进行评估。
  • 通过将不完整患者记录投影到已学习的表型空间,实现缺失数据下的表型推断。

实验结果

研究问题

  • RQ1能否从EHR中提取基于表型的患者相似性特征,以提升疾病进展预测模型的准确性?
  • RQ2NMF导出的表型是否捕捉到了临床上有意义且一致的医疗服务使用模式?
  • RQ3表型特征的引入如何影响不同架构下模型的可解释性与性能表现?
  • RQ4表型特征能否缓解常规服务在患者相似性计算中的主导影响?
  • RQ5表型增强的模型在预测慢性淋巴细胞白血病(CLL)诊断方面,相较于基线模型的优越程度如何?

主要发现

  • 在所有测试模型(包括逻辑回归、随机森林、CNN和Wide & Deep)中,加入NMF导出的表型特征后,PR-AUC平均提升超过2%。
  • 在所有敏感度水平下,加入表型特征后F1分数均持续提升,尤其在较高敏感度阈值(如0.35–0.4)时相对增益最大。
  • 集成表型特征的Wide & Deep模型在15%敏感度下PR-AUC达到0.2483,在30%敏感度下达到0.3579,优于其基线版本。
  • 通过NMF学习到的表型在临床上具有一致性,且与特定疾病(如CLL)相关,显著增强了模型的可解释性。
  • 该方法即使在存在缺失数据的情况下,也能通过投影到已学习的表型空间,实现对患者画像的稳健推断。
  • 该方法在多种模型架构中均表现出通用实用性,表明其在临床预测任务中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。