Skip to main content
QUICK REVIEW

[论文解读] Contrastive Learning for Multi Label ECG Classification with Jaccard Score Based Sigmoid Loss

Junichiro Takahashi, Masataka Sato|arXiv (Cornell University)|Feb 11, 2026
ECG Monitoring and Analysis被引用 0
一句话总结

该论文用真实世界数据通过 SigLIP 训练 ECG 编码器,并引入基于 Jaccard 的 Sigmoid 损失以实现真正的多标签 ECG 分类,在微观 F1 和 Jaccard 分数上取得改进,嵌入维度和数据增强带来进一步提升。

ABSTRACT

Recent advances in large language models (LLMs) have enabled the development of multimodal medical AI. While models such as MedGemini achieve high accuracy on VQA tasks like USMLE MM, their performance on ECG based tasks remains limited, and some models, such as MedGemma, do not support ECG data at all. Interpreting ECGs is inherently challenging, and diagnostic accuracy can vary depending on the interpreter's experience. Although echocardiography provides rich diagnostic information, it requires specialized equipment and personnel, limiting its availability. In this study, we focus on constructing a robust ECG encoder for multimodal pretraining using real world hospital data. We employ SigLIP, a CLIP based model with a sigmoid based loss function enabling multi label prediction, and introduce a modified loss function tailored to the multi label nature of ECG data. Experiments demonstrate that incorporating medical knowledge in the language model and applying the modified loss significantly improve multi label ECG classification. To further enhance performance, we increase the embedding dimensionality and apply random cropping to mitigate data drift. Finally, per label analysis reveals which ECG findings are easier or harder to predict. Our study provides a foundational framework for developing medical models that utilize ECG data.

研究动机与目标

  • 以真实世界医院数据实现鲁棒的多模态 ECG 编码以用于多标签预测。
  • 开发并测试一个修订的 sigmoid 损失,融入 Jaccard 相似度以用于 ECG 发现的多标签处理。
  • 评估在 ECG 预训练中引入医学知识的语言模型的影响。
  • 探索如更高的嵌入维度与随机裁剪等改进以缓解数据漂移。

提出的方法

  • 将一个 1D ResNet-18 作为 ECG 编码器,Qwen3-8B 作为语言模型。
  • 将基于 CrossEntropy 的 CLIP 损失替换为基于 sigmoid 的损失(SigLIP)并引入基于 Jaccard 的眼矩阵以处理多标签预测。
  • 在 33,732 例真实世界 ECG 上训练,12 导联、500 Hz、10 s 记录;文本描述发现。
  • 比较标准 SigLIP 损失与结合 Jaccard 相似度的修改 Sigmoid 损失在批内交互中的效果。
  • 使用霍曼损失、微观精度、微观召回、微观 F1、以及 Jaccard 指数进行评估;对嵌入尺寸和数据增强(随机裁剪)进行消融。
  • 尝试不同 ECG 知识水平的语言模型以评估领域知识对效用的影响。)
Contrastive Learning for Multi Label ECG Classification with Jaccard Score Based Sigmoid Loss

实验结果

研究问题

  • RQ1 SigLIP 基础的 ECG 编码器是否能处理来自真实世界 ECG 的多标签发现?
  • RQ2基于 Jaccard 的 sigmoid 损失是否在多标签 ECG 分类性能上优于标准 SigLIP 损失?
  • RQ3嵌入维度和随机裁剪如何影响多标签 ECG 的性能?
  • RQ4语言模型中的 ECG 领域知识对预训练效果有何影响?

主要发现

  • 修改的 Sigmoid 损失结合 Jaccard 相似性在多标签指标上优于标准 SigLIP 损失(如霍曼损失降低、F1 Micro 提升、Jaccard 提高)。
  • 将嵌入维度提升到 256 并应用随机裁剪显著提升性能(F1 Micro 达到 0.5028,Jaccard 达到 0.3495)。
  • 基线 SigLIP 配合 256 维嵌入和随机裁剪(600 轮训练、20k 预热)相较基线实现显著提升(F1 Micro 0.503 对 0.3082)。
  • 语言模型中的医学知识(Qwen3-8B 与 Gemma3-4B)的差异与更高的微观精度/召回率及 Jaccard 指数相关,且与所提损失一致。
  • 最终模型实现对每个标签的细分洞察,例如低 EF 与 房颤更易预测,而某些与冠状动脉MI相关的标签较难,且在不同医院数据上测试时性能相对稳定。
Contrastive Learning for Multi Label ECG Classification with Jaccard Score Based Sigmoid Loss

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。