Skip to main content
QUICK REVIEW

[论文解读] CROCS: Clustering and Retrieval of Cardiac Signals Based on Patient Disease Class, Sex, and Age

Dani Kiyasseh, Tingting Zhu|arXiv (Cornell University)|Nov 28, 2020
Machine Learning in Healthcare被引用 4
一句话总结

CROCS 是一种监督对比学习框架,通过患者属性(如疾病类型、性别和年龄)对心脏信号进行聚类和检索。通过学习吸引相似患者特征表示的临床原型,CROCS 在聚类(在 Chapman 数据集上准确率达 90.3%,AMI 为 72.8%)和检索任务中均优于当前最先进方法,同时实现了语义可解释的、基于属性的 ECG 数据组织。

ABSTRACT

The process of manually searching for relevant instances in, and extracting information from, clinical databases underpin a multitude of clinical tasks. Such tasks include disease diagnosis, clinical trial recruitment, and continuing medical education. This manual search-and-extract process, however, has been hampered by the growth of large-scale clinical databases and the increased prevalence of unlabelled instances. To address this challenge, we propose a supervised contrastive learning framework, CROCS, where representations of cardiac signals associated with a set of patient-specific attributes (e.g., disease class, sex, age) are attracted to learnable embeddings entitled clinical prototypes. We exploit such prototypes for both the clustering and retrieval of unlabelled cardiac signals based on multiple patient attributes. We show that CROCS outperforms the state-of-the-art method, DTC, when clustering and also retrieves relevant cardiac signals from a large database. We also show that clinical prototypes adopt a semantically meaningful arrangement based on patient attributes and thus confer a high degree of interpretability.

研究动机与目标

  • 为解决在大规模未标注临床数据库中手动搜索相关心脏信号的挑战。
  • 开发一个统一框架,支持基于多种患者属性的 ECG 信号聚类与检索。
  • 通过根据患者特征以语义有意义的方式组织学习到的临床原型,提升可解释性。
  • 在真实世界 ECG 数据库上,实现聚类与检索性能超越现有方法。

提出的方法

  • CROCS 使用神经网络将心脏信号嵌入基于输入 ECG 数据的密集表示。
  • 针对每种患者属性的唯一组合(如疾病类型、性别、年龄)引入可学习的临床原型,作为相似信号表示的吸引子。
  • 框架采用软分配对比损失(NCE-soft),以促使表示围绕具有相同属性的原型聚集。
  • 应用正则化项以确保原型保持属性之间的语义关系,提升可解释性。
  • 模型通过联合损失端到端训练:NCE-soft 损失用于表示学习,正则化损失用于原型语义。
  • 训练完成后,原型支持聚类(通过将信号分配给最近的原型)和检索(通过属性组合查询)

实验结果

研究问题

  • RQ1统一的深度学习框架能否有效利用多种患者属性,同时实现对未标注心脏信号的聚类与检索?
  • RQ2与现有方法相比,可学习的临床原型在聚类与检索性能方面有何提升?
  • RQ3所学习的原型在多大程度上反映了疾病类型、性别和年龄等患者属性之间的有意义语义关系?
  • RQ4在多属性设置下,表示的软分配相比硬分配是否能带来更好的性能?
  • RQ5该框架是否能在实现聚类与检索任务的最先进性能的同时,保持高度可解释性?

主要发现

  • 在 Chapman ECG 数据库上,CROCS 在基于疾病类型的聚类中达到 90.3% 的准确率和 72.8% 的 AMI,优于当前最先进方法 DTC。
  • 在 PTB-XL 数据集上,CROCS 在疾病类型聚类中达到 76.0% 的准确率和 76.1% 的 AMI,展现出跨数据集的鲁棒性。
  • 采用软分配与正则化(NCE-soft + reg)的框架始终优于其他变体,在 Chapman 数据集上对性别与年龄属性的聚类达到 57.4% 的准确率和 38.0% 的 AMI。
  • 临床原型被发现具有语义有序排列,相似属性组合形成连贯聚类,显著增强了可解释性。
  • 消融实验表明,软分配与正则化项显著提升了性能与原型的可解释性。
  • CROCS 能够基于多属性查询成功检索相关心脏信号,其在聚类与检索任务中的性能均优于 DTC。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。