Skip to main content
QUICK REVIEW

[论文解读] Machine Learning-Based Classification Algorithms for the Prediction of Coronary Heart Diseases

Kelvin Kwakye, Emmanuel Dadzie|arXiv (Cornell University)|Dec 2, 2021
Artificial Intelligence in Healthcare被引用 10
一句话总结

本研究使用标准化数据集,评估了多种机器学习算法在预测冠状动脉性心脏病(CHD)方面的表现,采用SMOTE处理类别不平衡问题,并结合特征选择以提升性能。在原始数据集上,逻辑回归取得了最高的准确率,表明在经过适当的数据预处理后,该方法在CHD预测中具有显著有效性。

ABSTRACT

Coronary heart disease, which is a form of cardiovascular disease (CVD), is the leading cause of death worldwide. The odds of survival are good if it is found or diagnosed early. The current report discusses a comparative approach to the classification of coronary heart disease datasets using machine learning (ML) algorithms. The current study created and tested several machine-learning-based classification models. The dataset was subjected to Smote to handle unbalanced classes and feature selection technique in order to assess the impact on two distinct performance metrics. The results show that logistic regression produced the highest performance score on the original dataset compared to the other algorithms employed. In conclusion, this study suggests that LR on a well-processed and standardized dataset can predict coronary heart disease with greater accuracy than the other algorithms.

研究动机与目标

  • 评估多种机器学习算法在预测冠状动脉性心脏病(CHD)方面的性能。
  • 评估数据预处理技术(特别是用于处理类别不平衡的SMOTE和特征选择)对模型性能的影响。
  • 利用真实世界临床数据,识别在CHD预测中最为准确的机器学习模型。
  • 通过准确率和ROC曲线下面积(AUC)两个关键指标比较模型性能。

提出的方法

  • 本研究采用了多种机器学习分类算法,包括逻辑回归、支持向量机、随机森林和K近邻算法。
  • 使用SMOTE(合成少数类过采样技术)对数据集进行预处理,以解决冠状动脉性心脏病数据中的类别不平衡问题。
  • 应用特征选择以降低维度并提升模型泛化能力。
  • 采用两个主要指标评估性能:分类准确率和AUC-ROC。
  • 所有模型均在数据集的标准化版本上进行训练和测试,以确保比较的一致性。
  • 分析比较了原始数据集与经预处理(SMOTE处理和特征选择)后的数据集的结果,以隔离预处理对性能的影响。

实验结果

研究问题

  • RQ1在原始数据集上,哪种机器学习算法在冠状动脉性心脏病预测中达到最高的预测准确率?
  • RQ2应用SMOTE处理类别不平衡问题,对不同分类算法的性能有何影响?
  • RQ3特征选择在多大程度上提升了机器学习模型在CHD预测中的预测性能?
  • RQ4在数据预处理后,不同算法的性能指标(准确率和AUC-ROC)如何变化?
  • RQ5当应用于经过良好处理和标准化的冠状动脉性心脏病数据集时,逻辑回归是否优于其他算法?

主要发现

  • 在所有测试的算法中,逻辑回归在原始数据集上取得了最高的性能得分。
  • 应用SMOTE和特征选择后,模型性能得到提升,但提升幅度在不同算法间存在差异。
  • 在所有评估的模型中,逻辑回归在未经修改的数据集上表现出最一致且最高的准确率。
  • 研究发现,数据预处理显著增强了机器学习模型在CHD预测中的预测能力。
  • 在原始数据集上,逻辑回归在准确率和AUC-ROC指标上均优于更复杂的模型,如随机森林和支持向量机。
  • 结果表明,当数据集经过良好处理和标准化后,逻辑回归是CHD预测中一种稳健且高效的选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。