Skip to main content
QUICK REVIEW

[论文解读] An Unsupervised Homogenization Pipeline for Clustering Similar Patients using Electronic Health Record Data

Alvaro Ulloa, Anna O. Basile|arXiv (Cornell University)|Dec 30, 2017
Machine Learning in Healthcare参考文献 8被引用 5
一句话总结

本文提出了一种无监督均质化流程,用于使用电子健康记录(EHR)数据对患者进行聚类,整合了多重插补法(MICE)、归一化和特征降维技术。最优流程——MICE结合局部线性嵌入(LLE)或MICE结合Z得分与深度自编码器(DAE)——在具有冗余性、异质性和缺失性的模拟EHR数据上实现了高聚类准确率,展示了其在精准医学应用中的鲁棒性。

ABSTRACT

Electronic health records (EHR) contain a large variety of information on the clinical history of patients such as vital signs, demographics, diagnostic codes and imaging data. The enormous potential for discovery in this rich dataset is hampered by its complexity and heterogeneity. We present the first study to assess unsupervised homogenization pipelines designed for EHR clustering. To identify the optimal pipeline, we tested accuracy on simulated data with varying amounts of redundancy, heterogeneity, and missingness. We identified two optimal pipelines: 1) Multiple Imputation by Chained Equations (MICE) combined with Local Linear Embedding; and 2) MICE, Z-scoring, and Deep Autoencoders.

研究动机与目标

  • 解决在异质性、不完整且嘈杂的EHR数据中聚类患者所面临的挑战。
  • 开发并验证一个综合的无监督均质化流程,整合插补、归一化、特征降维和聚类。
  • 识别在数据复杂性下检测出具有生物学意义的患者聚类的最鲁棒流程配置。
  • 通过具有可控真实标签的模拟EHR数据评估流程性能,以进行准确率评估。
  • 提供一个经验证的端到端框架,适用于真实世界EHR数据集的无监督表型识别。

提出的方法

  • 通过投影生成冗余性,通过量化和缩放生成异质性,通过高斯扰动引入噪声,生成具有三个聚类的模拟EHR数据。
  • 测试的插补技术包括中位数插补、k-最近邻(KNN)和多重插补法(MICE),其中MICE被选为最优方法。
  • 评估的归一化方法包括Z得分、MinMax和白化,其中Z得分用于最优DAE流程。
  • 通过重构误差对超参数进行调优,使用局部线性嵌入(LLE)和深度自编码器(DAE)进行特征降维。
  • 使用调整兰德指数(ARI)在具有不同冗余度、缺失率和噪声水平的模拟数据上评估聚类性能。
  • 在多种实验条件下对流程进行验证,包括噪声与缺失率之间的交互效应,以评估其鲁棒性。

实验结果

研究问题

  • RQ1在存在EHR数据缺失的情况下,哪种插补方法能产生最准确的聚类结果?
  • RQ2不同的归一化和特征降维技术如何影响在异质性和冗余性EHR数据上的聚类性能?
  • RQ3在不同噪声和缺失率水平下,LLE与DAE在保留聚类结构方面的相对性能如何?
  • RQ4结合MICE、归一化和特征降维的统一流程是否能始终优于单一组件在模拟EHR聚类中的表现?
  • RQ5数据质量因素(如噪声与缺失率)之间的交互作用如何影响所提出流程的鲁棒性?

主要发现

  • MICE在所有特征降维方法下均优于中位数插补和KNN,尤其在高缺失率和高冗余性条件下表现更优。
  • 结合MICE与局部线性嵌入(LLE)的流程实现了最高的聚类准确率,在中等效应大小和高无信息噪声条件下,比DAE高出0.05–0.12 ARI。
  • MICE–Z得分–DAE流程表现出色,并在计算效率上具有优势,时间复杂度为O(m log(k)n log(n)),优于LLE的O(nm)。
  • LLE在检测具有1–5%样本重叠的细微表型方面表现出更强的敏感性,表明其在识别细微疾病亚型方面更具优势。
  • 交互实验表明,在特定的噪声与缺失率组合下,DAE与LLE表现出显著的性能差异,其中DAE在高缺失率下更为稳定。
  • 本研究识别出两种最优流程:MICE + LLE 和 MICE + Z得分 + DAE,二者在各种数据质量条件下均表现出鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。