[논문 리뷰] Machine Learning-Based Classification Algorithms for the Prediction of Coronary Heart Diseases
이 연구는 표준화된 데이터셋을 사용하여 관상동맥 심장병(CHD) 예측을 위한 다양한 기계학습 알고리즘을 평가하며, 클래스 불균형을 해결하기 위해 SMOTE를 적용하고 특징 선택을 통해 성능을 향상시켰다. 원본 데이터셋에서 로지스틱 회귀가 가장 높은 정확도를 기록하여, 적절한 데이터 전처리와 함께 적용될 경우 CHD 예측에 효과적임을 입증하였다.
Coronary heart disease, which is a form of cardiovascular disease (CVD), is the leading cause of death worldwide. The odds of survival are good if it is found or diagnosed early. The current report discusses a comparative approach to the classification of coronary heart disease datasets using machine learning (ML) algorithms. The current study created and tested several machine-learning-based classification models. The dataset was subjected to Smote to handle unbalanced classes and feature selection technique in order to assess the impact on two distinct performance metrics. The results show that logistic regression produced the highest performance score on the original dataset compared to the other algorithms employed. In conclusion, this study suggests that LR on a well-processed and standardized dataset can predict coronary heart disease with greater accuracy than the other algorithms.
연구 동기 및 목표
- 다양한 기계학습 알고리즘의 관상동맥 심장병(CHD) 예측 성능을 평가하는 것.
- 특히 클래스 불균형 처리를 위한 SMOTE 및 특징 선택과 같은 데이터 전처리 기법이 모델 성능에 미치는 영향을 평가하는 것.
- 실제 임상 데이터를 기반으로 관상동맥 심장병 예측에 가장 정확한 기계학습 모델을 특정하는 것.
- 정확도와 ROC 곡선 아래 면적(AUC)이라는 두 가지 주요 지표를 사용하여 모델 성능을 비교하는 것.
제안 방법
- 연구는 로지스틱 회귀, 서포트 벡터 머신, 랜덤 포레스트, k-최근접 이웃 등 다양한 기계학습 분류 알고리즘을 사용하였다.
- 관상동맥 심장병 데이터의 클래스 불균형 문제를 해결하기 위해 SMOTE(Synthetic Minority Over-sampling Technique)를 사용하여 데이터를 전처리하였다.
- 차원 축소 및 모델 일반화 향상을 위해 특징 선택 기법을 적용하였다.
- 성능 평가에는 분류 정확도와 AUC-ROC가 주요 지표로 사용되었다.
- 모델들은 일관된 비교를 보장하기 위해 표준화된 데이터셋을 기반으로 훈련 및 테스트하였다.
- 원본 데이터셋과 전처리된(SMOTE 및 특징 선택 적용) 데이터셋 간의 성능을 비교하여 전처리의 영향을 분리 분석하였다.
실험 결과
연구 질문
- RQ1원본 데이터셋에서 어떤 기계학습 알고리즘이 관상동맥 심장병 예측 정확도가 가장 높은가?
- RQ2클래스 불균형 문제를 해결하기 위해 SMOTE를 적용할 경우, 다양한 분류 알고리즘의 성능에 어떤 영향을 미치는가?
- RQ3특징 선택이 기계학습 모델의 CHD 예측 성능 향상에 어느 정도 기여하는가?
- RQ4데이터 전처리 후, 다양한 알고리즘 간 정확도 및 AUC-ROC 성능 지표는 어떻게 변화하는가?
- RQ5잘 전처리되고 표준화된 관상동맥 심장병 데이터셋에 적용되었을 때, 로지스틱 회귀가 다른 알고리즘보다 뛰어난가?
주요 결과
- 테스트된 다른 알고리즘과 비교해 로지스틱 회귀가 원본 데이터셋에서 가장 높은 성능 점수를 기록하였다.
- SMOTE 및 특징 선택 적용으로 인해 모든 알고리즘의 성능 향상이 관찰되었지만, 그 정도는 알고리즘에 따라 달라졌다.
- 모든 평가된 모델 중에서 로지스틱 회귀가 원본 데이터셋에서 가장 일관되고 높은 정확도를 보였다.
- 연구 결과에 따르면, 데이터 전처리가 기계학습 모델의 CHD 예측 능력을 크게 향상시킨다.
- 원본 데이터셋에서 로지스틱 회귀는 랜덤 포레스트 및 서포트 벡터 머신과 같은 더 복잡한 모델들보다 정확도와 AUC-ROC 측면에서 뛰어난 성능을 보였다.
- 결과적으로, 데이터셋이 잘 전처리되고 표준화된 경우 로지스틱 회귀는 CHD 예측에 강력하고 효과적인 선택임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.