[论文解读] Analysis of a Deep Learning Model for 12-Lead ECG Classification Reveals Learned Features Similar to Diagnostic Criteria
本研究应用可解释人工智能(XAI)方法——梯度积分法(integrated gradients)与逐层相关性传播(layer-wise relevance propagation)——对预训练的深度神经网络进行12导联系谱分类分析,结果表明模型学习到的特征与临床诊断标准一致。关键发现显示,相关性分数与教科书知识相符:心房颤动(AF)中可见P波为负值,左束支传导阻滞(LBBB)中T波与QRS波群同向时为负值,而异常QRS波形态则主导LBBB的检测。
Despite their remarkable performance, deep neural networks remain unadopted in clinical practice, which is considered to be partially due to their lack in explainability. In this work, we apply attribution methods to a pre-trained deep neural network (DNN) for 12-lead electrocardiography classification to open this "black box" and understand the relationship between model prediction and learned features. We classify data from a public data set and the attribution methods assign a "relevance score" to each sample of the classified signals. This allows analyzing what the network learned during training, for which we propose quantitative methods: average relevance scores over a) classes, b) leads, and c) average beats. The analyses of relevance scores for atrial fibrillation (AF) and left bundle branch block (LBBB) compared to healthy controls show that their mean values a) increase with higher classification probability and correspond to false classifications when around zero, and b) correspond to clinical recommendations regarding which lead to consider. Furthermore, c) visible P-waves and concordant T-waves result in clearly negative relevance scores in AF and LBBB classification, respectively. In summary, our analysis suggests that the DNN learned features similar to cardiology textbook knowledge.
研究动机与目标
- 为解决深度学习在心电图分析中临床应用的障碍,通过提升模型可解释性。
- 探究深度神经网络(DNN)是否学习到与既定心脏病学诊断标准一致的特征。
- 开发并验证用于分析各类别、导联及心跳相关性分数的定量方法。
- 对比两种公开心电图数据库(CPSC 2018 与 PTB-XL)中模型行为,评估其鲁棒性。
- 评估伪影对模型预测及相关性归因的影响。
提出的方法
- 应用梯度积分法(IG)与逐层相关性传播(LRP)为12导联心电图信号中每个样本分配相关性分数。
- 采用Ribeiro等人提出的预训练DNN模型,用于CPSC 2018与PTB-XL数据库的27类心电图分类。
- 提出三种定量分析框架:按类别平均相关性、按导联平均相关性、按平均心跳平均相关性。
- 将相关性分数可视化为热图与时间序列叠加图,以关联特征与临床心电图模式。
- 经心脏病专家验证,并对比不同数据库及XAI方法的结果。
- 对伪影及相关性分数中的时间模式开展消融研究。
实验结果
研究问题
- RQ1用于12导联心电图分类的DNN所学习的特征是否与公认的临床诊断标准一致?
- RQ2相关性分数在不同心电图异常(如AF、LBBB)及不同导联间如何变化?
- RQ3对相关性分数的定量分析能否揭示模型依赖形态学特征还是时间特征?
- RQ4模型在不同心电图数据库(患者人群与标注存在差异)中的解释是否具有鲁棒性?
- RQ5伪影在多大程度上扭曲模型注意力并导致误分类?
主要发现
- 心房颤动(AF)的相关性分数在P波可见时升高,表明模型将P波缺失或异常视为诊断标志。
- 左束支传导阻滞(LBBB)的相关性分数在异常QRS波形态时最高,而T波与QRS波群同向时最低,与临床标准一致。
- 模型对与疾病相反的特征赋予负相关性——例如AF中正常的P波,以及LBBB中同向的T波——证实其与教科书知识一致。
- LBBB的相关性分数与临床指南高度对应,尤其在V1和aVL导联,异常QRS波形态最具诊断意义。
- 误分类常伴随相关性分数接近零,表明当存在噪声或伪影时,模型未能关注关键特征。
- IG与LRP两种方法在不同数据库中结果一致,且IG生成的热图更具区分度与临床可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。