[论文解读] Machine Learning-Based Heart Disease Diagnosis: A Systematic Literature Review
本篇系统性文献回顾分析了基于机器学习的心脏病诊断方法,重点关注由心电图(ECG)和患者数据不平衡带来的挑战。通过分析49项研究,采用数据级和算法级技术(如SMOTE、焦点损失和代价敏感学习),发现先进方法的准确率最高可达99.88%,但仍因类别不平衡问题在可解释性和公平性方面存在不足。
Heart disease is one of the significant challenges in today's world and one of the leading causes of many deaths worldwide. Recent advancement of machine learning (ML) application demonstrates that using electrocardiogram (ECG) and patient data, detecting heart disease during the early stage is feasible. However, both ECG and patient data are often imbalanced, which ultimately raises a challenge for the traditional ML to perform unbiasedly. Over the years, several data level and algorithm level solutions have been exposed by many researchers and practitioners. To provide a broader view of the existing literature, this study takes a systematic literature review (SLR) approach to uncover the challenges associated with imbalanced data in heart diseases predictions. Before that, we conducted a meta-analysis using 451 referenced literature acquired from the reputed journals between 2012 and November 15, 2021. For in-depth analysis, 49 referenced literature has been considered and studied, taking into account the following factors: heart disease type, algorithms, applications, and solutions. Our SLR study revealed that the current approaches encounter various open problems/issues when dealing with imbalanced data, eventually hindering their practical applicability and functionality.
研究动机与目标
- 识别并分析使用不平衡心电图和患者数据集进行基于机器学习的心脏病诊断的当前方法。
- 评估数据级和算法级技术在减轻心脏病预测中对多数类偏倚方面的有效性。
- 通过系统性文献回顾(SLR)方法,评估机器学习模型在临床应用中的性能、可解释性和公平性。
- 突出基于机器学习的心脏病诊断中持续存在的挑战、研究空白以及未来研究方向,尤其关注数据不平衡问题。
提出的方法
- 基于2012年至2021年11月期间来自权威期刊的451篇参考文献,开展系统性文献回顾(SLR)。
- 根据相关性、方法论和数据质量标准,筛选出49项高质量研究进行深入分析。
- 按心脏病类型、机器学习算法、应用背景及不平衡缓解技术对研究进行分类。
- 将不平衡解决方案划分为数据级(如SMOTE、ADASYN、基于生成对抗网络的增强)和算法级(如焦点损失、代价敏感学习)。
- 使用标准指标评估性能:准确率(A_c)、精确率(P_c)、召回率(R_c)、F1分数(F_c)、特异性(S_p)、敏感性(S_e)及AUC。
- 开展元分析和内容分析,以识别现有文献中的趋势、局限性及研究空白。

实验结果
研究问题
- RQ1在使用不平衡心电图和患者数据进行心脏病诊断时,最常使用的机器学习算法有哪些?
- RQ2数据级和算法级技术在提升不平衡心脏病数据集上模型性能方面的有效性如何?
- RQ3各研究报告的关键性能指标有哪些?这些指标如何随数据集和方法论而变化?
- RQ4在心脏病诊断中,机器学习模型在可解释性、公平性和泛化能力方面持续面临哪些挑战?
- RQ5在基于机器学习的心脏病诊断中,主要的研究空白和未来机遇是什么,尤其是针对数据不平衡问题?
主要发现
- 数据级技术如SMOTE、ADASYN以及基于生成对抗网络的数据增强被最频繁使用,其中SMOTE在49项研究中有12项采用。
- 算法级方法如焦点损失和代价敏感学习在深度学习模型中日益普及,以应对类别不平衡问题。
- 报告的最高准确率为99.88%,采用的是在MIT-BIH心律失常数据集上结合SMOTE-Tomek Link的混合CNN-LSTM模型。
- F1分数范围为0.79至0.9659,最佳表现(F_c = 0.9659)由使用时空特征提取的DNN模型在MIT-BIH数据集上实现。
- 敏感性和特异性值通常较高(分别为99.34%和99.82%),表明对阳性病例的检测能力很强。
- 尽管准确率较高,但许多模型缺乏可解释性,且仅有少数研究在准确率指标之外关注公平性和偏差缓解。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。