Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning-Based Classification Algorithms for the Prediction of Coronary Heart Diseases

Kelvin Kwakye, Emmanuel Dadzie|arXiv (Cornell University)|Dec 2, 2021
Artificial Intelligence in Healthcare被引用数 10
ひとこと要約

本研究では、標準化されたデータセットを用いて冠動脈疾患(CHD)予測のための複数の機械学習アルゴリズムを評価し、クラス不均衡の解消にSMOTEを適用し、特徴量選択を実施することで性能を向上させた。ロジスティック回帰が元のデータセットで最高の正解率を示し、適切なデータ前処理を組み合わせることでCHD予測に有効であることが示された。

ABSTRACT

Coronary heart disease, which is a form of cardiovascular disease (CVD), is the leading cause of death worldwide. The odds of survival are good if it is found or diagnosed early. The current report discusses a comparative approach to the classification of coronary heart disease datasets using machine learning (ML) algorithms. The current study created and tested several machine-learning-based classification models. The dataset was subjected to Smote to handle unbalanced classes and feature selection technique in order to assess the impact on two distinct performance metrics. The results show that logistic regression produced the highest performance score on the original dataset compared to the other algorithms employed. In conclusion, this study suggests that LR on a well-processed and standardized dataset can predict coronary heart disease with greater accuracy than the other algorithms.

研究の動機と目的

  • 様々な機械学習分類アルゴリズムが冠動脈疾患(CHD)を予測する性能を評価すること。
  • 特にクラス不均衡の処理に向けたSMOTEと特徴量選択のデータ前処理技術がモデル性能に与える影響を評価すること。
  • 実世界の臨床データを用いて、CHD予測において最も高い正確性を示す機械学習モデルを特定すること。
  • 正解率と受信者リポジトリ特性曲線(AUC)の2つの主要な指標を用いて、モデルの性能を比較すること。

提案手法

  • 本研究では、ロジスティック回帰、サポートベクターマシン、ランダムフォレスト、k近傍法を含む多様な機械学習分類アルゴリズムを用いた。
  • データセットは、冠動脈疾患データにおけるクラス不均衡に対処するため、SMOTE(合成 Minority オーバーサンプリング技術)を用いて前処理された。
  • 次元削減とモデルの一般化性能向上を目的として、特徴量選択が適用された。
  • 性能評価には、分類正解率とAUC-ROCの2つの主要な指標が用いられた。
  • 一貫性を確保するため、モデルは標準化されたデータセットを用いて学習およびテストされた。
  • 前処理(SMOTEおよび特徴量選択)を施したデータセットと元のデータセットの両方で結果を比較し、前処理の影響を明確にした。

実験結果

リサーチクエスチョン

  • RQ1元のデータセットにおいて、どの機械学習アルゴリズムが冠動脈疾患予測において最も高い予測正解率を達成するか?
  • RQ2クラス不均衡の処理にSMOTEを適用することで、異なる分類アルゴリズムの性能にどのような影響を与えるか?
  • RQ3特徴量選択は、CHD予測のための機械学習モデルの予測性能をどの程度向上させるか?
  • RQ4データ前処理後、さまざまなアルゴリズムにおける性能指標(正解率とAUC-ROC)はどのように変化するか?
  • RQ5適切に前処理され、標準化された冠動脈疾患データセットに対して、ロジスティック回帰が他のアルゴリズムを上回るか?

主な発見

  • ロジスティック回帰は、テストした他のアルゴリズムと比較して、元のデータセットで最高の性能スコアを達成した。
  • SMOTEと特徴量選択の適用により、モデル性能が向上したが、その向上幅はアルゴリズムごとに異なった。
  • 評価されたすべてのモデルの中で、ロジスティック回帰は元のデータセットにおいて最も一貫性があり、高い正解率を示した。
  • 本研究では、データ前処理が機械学習モデルのCHD予測能力を顕著に向上させることを明らかにした。
  • ロジスティック回帰は、ランダムフォレストやサポートベクターマシンといったより複雑なモデルよりも、元のデータセットにおける正解率とAUC-ROCの両面で優れた性能を示した。
  • 結果から、データセットが適切に前処理され、標準化された場合には、ロジスティック回帰がCHD予測に堅牢かつ効果的な選択肢であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。