[论文解读] ECG Semantic Integrator (ESI): A Foundation ECG Model Pretrained with LLM-Enhanced Cardiological Text
本文提出 ECG Semantic Integrator (ESI),一种基础模型,通过结合 LLM 增强的文本描述与多模态对比学习及字幕生成预训练,提升 ECG 表征学习效果。利用检索增强生成流水线(CQA)生成丰富、标准化的 ECG 报告,ESI 在心律失常检测(AUC 提升 1.6%)和基于 ECG 的个体识别(提升 3.5%)任务上超越强基线自监督方法,达到当前最优性能。
The utilization of deep learning on electrocardiogram (ECG) analysis has brought the advanced accuracy and efficiency of cardiac healthcare diagnostics. By leveraging the capabilities of deep learning in semantic understanding, especially in feature extraction and representation learning, this study introduces a new multimodal contrastive pretaining framework that aims to improve the quality and robustness of learned representations of 12-lead ECG signals. Our framework comprises two key components, including Cardio Query Assistant (CQA) and ECG Semantics Integrator(ESI). CQA integrates a retrieval-augmented generation (RAG) pipeline to leverage large language models (LLMs) and external medical knowledge to generate detailed textual descriptions of ECGs. The generated text is enriched with information about demographics and waveform patterns. ESI integrates both contrastive and captioning loss to pretrain ECG encoders for enhanced representations. We validate our approach through various downstream tasks, including arrhythmia detection and ECG-based subject identification. Our experimental results demonstrate substantial improvements over strong baselines in these tasks. These baselines encompass supervised and self-supervised learning methods, as well as prior multimodal pretraining approaches.
研究动机与目标
- 解决预训练中 ECG 信号缺乏丰富、语义丰富的文本描述的问题。
- 通过整合 LLM 生成报告中的临床语义信息,改进 ECG 表征学习。
- 开发一种多模态预训练框架,联合优化对比学习与字幕生成目标,用于 ECG 信号。
- 评估所学表征在下游任务(如心律失常分类与个体识别)中的鲁棒性与泛化能力。
- 探究 ECG 与文本对齐质量对模型性能的影响。
提出的方法
- 采用检索增强生成(RAG)流水线——心血管查询助手(CQA),利用大语言模型与外部医学知识生成详细、标准化的 ECG 报告。
- CQA 通过整合人口统计学数据、诊断状况及波形模式细节,丰富 ECG 描述。
- ECG 语义整合器(ESI)框架采用双编码器架构,学习 ECG 信号与其文本描述的联合表征。
- ESI 同时应用对比损失(对齐匹配的 ECG-文本对)与字幕损失(从 ECG 特征重建文本描述)。
- 预训练在约 650,000 份 12 导联 ECG 上进行,使用 CQA 生成的文本,随后通过线性探测进行下游评估。
- 该框架在 PTB-XL 与 ICBEB 心律失常数据集上进行评估,并对数据规模与 ECG-文本错配问题进行消融研究。
实验结果
研究问题
- RQ1LLM 增强的、检索增强的文本描述能否提升 ECG 表征学习的质量?
- RQ2联合使用对比损失与字幕损失进行预训练,如何影响下游 ECG 分析性能?
- RQ3预训练数据规模与分布偏移对模型泛化能力有何影响?
- RQ4模型对 ECG 信号与其文本描述之间错配的敏感度如何?
- RQ5所提出的框架能否在心律失常检测与基于 ECG 的个体识别任务中超越强监督与自监督基线?
主要发现
- 与先前自监督学习方法相比,ESI 在 PTB-XL 与 ICBEB 数据集上的心律失常分类任务中,AUC 提升 1.6%(绝对值)。
- ESI 相较于强自监督基线,个体识别性能提升 3.5%,表明其对个体 ECG 特征的泛化能力更优。
- 随着预训练数据集规模增大,性能显著提升,且在数据扩展的早期阶段获得最显著增益。
- 随着预训练数据规模增加,预训练集与测试集之间的最大均值差异(MMD)减小,表明分布偏移减少,泛化能力增强。
- 引入 ECG-文本错配会严重降低模型性能,当错配率超过 20% 时,性能甚至劣于随机初始化,凸显准确配对的关键作用。
- 消融研究证实,对比损失与字幕损失均不可或缺,联合优化相比单损失训练可获得更优表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。