Skip to main content
QUICK REVIEW

[论文解读] Patient similarity: methods and applications

Leyu Dai, He Zhu|arXiv (Cornell University)|Dec 1, 2020
Machine Learning in Healthcare参考文献 54被引用 7
一句话总结

本文综述了患者相似性分析的方法与应用,整合异质性电子健康记录和'组学'数据,构建患者相似性网络以支持精准医学。文章概述了数据集成、相似性度量和聚类技术(包括K均值、谱聚类和自组织映射),并展示了其在疾病分型和个性化预测中的应用,临床案例涵盖胶质母细胞瘤、糖尿病和ICU死亡率预测。

ABSTRACT

Patient similarity analysis is important in health care applications. It takes patient information such as their electronic medical records and genetic data as input and computes the pairwise similarity between patients. Procedures of typical a patient similarity study can be divided into several steps including data integration, similarity measurement, and neighborhood identification. And according to an analysis of patient similarity, doctors can easily find the most suitable treatments. There are many methods to analyze the similarity such as cluster analysis. And during machine learning become more and more popular, Using neural networks such as CNN is a new hot topic. This review summarizes representative methods used in each step and discusses applications of patient similarity networks especially in the context of precision medicine.

研究动机与目标

  • 将患者相似性分析系统化为利用多样化临床与分子数据的精准医学框架。
  • 解决整合异质性数据类型(如电子健康记录、基因组学、蛋白质组学)为统一相似性表示的挑战。
  • 通过相似性网络识别具有临床意义的患者亚型,以改善诊断与治疗个性化。
  • 通过利用与目标个体最相似的患者队列,实现数据驱动的临床决策支持。
  • 探索先进的聚类与表征学习技术,以实现可扩展且准确的患者分组。

提出的方法

  • 采用早期、晚期或中间数据集成策略,整合异质性患者数据(连续型、分类型、二值型、时间序列型)。
  • 采用欧几里得距离、Jaccard指数及基于相关性的度量方法,计算患者间的成对相似性。
  • 应用K均值聚类,通过最小化组内平方和将患者划分为K个组。
  • 利用谱聚类,通过相似性矩阵的特征值进行降维,再执行聚类。
  • 采用自组织映射(SOMs)实现无监督、拓扑保持的降维与患者相似性的可视化。
  • 使用最大后验概率狄利克雷过程混合模型进行非参数聚类,可自动估计聚类数量。

实验结果

研究问题

  • RQ1如何有效整合异质性临床与分子数据,以计算有意义的患者相似性评分?
  • RQ2哪些相似性度量与聚类方法在识别生物学与临床相关的患者亚型方面最为有效?
  • RQ3患者相似性网络在临床环境中在多大程度上可提升个性化预测模型的性能?
  • RQ4无监督与半监督学习技术如何增强患者聚类与邻域识别?
  • RQ5在构建适用于精准医学的可扩展患者相似性网络时,面临的关键技术与数据相关挑战是什么?

主要发现

  • 患者相似性网络成功识别出胶质母细胞瘤患者中一个预后显著更优且对替莫唑胺反应更好的亚组。
  • 基于患者相似性的2型糖尿病分型揭示了与特定基因突变和共病相关的不同亚组。
  • K均值与谱聚类方法能有效根据临床与分子特征将肺泡炎与糖尿病患者分组。
  • 自组织映射实现了患者聚类的可视化,并揭示了复杂疾病数据中的拓扑关系。
  • 仅使用最相似患者进行模型训练,相比全局模型,显著提升了ICU死亡率预测的准确性。
  • 非参数聚类方法(如狄利克雷过程混合模型)可自动确定最优聚类数量,无需预先指定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。