[논문 리뷰] A Benchmark Study by using various Machine Learning Models for Predicting Covid-19 trends
이 벤치마크 연구는 실제 코로나19 데이터셋을 사용하여 확진자 수의 미래 추세를 예측하기 위해 다양한 기계학습 모델—선형 및 다항 회귀, KNN, SVM, 결정 트리, 랜덤 포레스트, 앙상블 방법(투표, 배깅, 스태킹), 딥러닝(ANN)—을 평가한다. 랜덤 포레스트와 앙상블 모델이 다른 모델들을 압도적으로 뛰어넘었으며, SVR와 라소 회귀는 데이터 내 복잡한 비선형 패턴을 분리하는 데 어려움을 겪어 성능이 열악했다.
Machine learning and deep learning play vital roles in predicting diseases in the medical field. Machine learning algorithms are widely classified as supervised, unsupervised, and reinforcement learning. This paper contains a detailed description of our experimental research work in that we used a supervised machine-learning algorithm to build our model for outbreaks of the novel Coronavirus that has spread over the whole world and caused many deaths, which is one of the most disastrous Pandemics in the history of the world. The people suffered physically and economically to survive in this lockdown. This work aims to understand better how machine learning, ensemble, and deep learning models work and are implemented in the real dataset. In our work, we are going to analyze the current trend or pattern of the coronavirus and then predict the further future of the covid-19 confirmed cases or new cases by training the past Covid-19 dataset by using the machine learning algorithm such as Linear Regression, Polynomial Regression, K-nearest neighbor, Decision Tree, Support Vector Machine and Random forest algorithm are used to train the model. The decision tree and the Random Forest algorithm perform better than SVR in this work. The performance of SVR and lasso regression are low in all prediction areas Because the SVR is challenging to separate the data using the hyperplane for this type of problem. So SVR mostly gives a lower performance in this problem. Ensemble (Voting, Bagging, and Stacking) and deep learning models(ANN) also predict well. After the prediction, we evaluated the model using MAE, MSE, RMSE, and MAPE. This work aims to find the trend/pattern of the covid-19.
연구 동기 및 목표
- 다양한 기계학습 모델의 효과성을 평가하여 향후 코로나19 확진자 수의 추세를 예측하는 것.
- 기존의 지도 학습 모델들(예: 선형 회귀, SVM, 결정 트리)과 앙상블 및 딥러닝 접근법을 비교하는 것.
- 실제 비선형 시계열 패닉 데이터에서 가장 잘 성능을 내는 모델을 특정하는 것.
- MAE, MSE, RMSE, MAPE와 같은 표준 회귀 지표를 사용하여 다양한 예측 시나리오에서의 모델 성능을 평가하는 것.
제안 방법
- 연구는 기계학습 모델의 학습을 위한 역사적 코로나19 확진자 수 데이터를 입력으로 사용한다.
- 평가된 모델에는 선형 회귀, 다항 회귀, K-최근접 이웃(KNN), 서포트 벡터 회귀(SVR), 결정 트리, 랜덤 포레스트, 앙상블 기법(투표, 배깅, 스태킹)이 포함된다.
- 딥러닝 기반 기준선으로 피드포워드 인공 신경망(ANN)도 구현되었다.
- 모델 학습과 예측은 확진자 수의 시계열 데이터를 대상으로 수행되며, 최적의 성능을 위해 초모수를 조정한다.
- 예측 정확도를 비교하기 위해 MAE, MSE, RMSE, MAPE를 사용하여 정량적 평가를 수행한다.
- 벤치마크는 개별 모델 평가와 앙상블 스태킹을 포함하여 일반화 및 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1다양한 데이터셋에서 미래의 코로나19 확진자 수를 가장 정확하게 예측할 수 있는 기계학습 모델은 무엇인가?
- RQ2SVR과 라소 회귀와 같은 전통적 모델은 패닉 데이터의 비선형 추세를 포착하는 데 앙상블 및 딥러닝 모델보다 어떻게 비교되는가?
- RQ3배깅, 스태킹 등의 앙상블 기법은 개별 모델 대비 예측 성능을 얼마나 향상시키는가?
- RQ4왜 SVR과 라소 회귀는 이 특정 시계열 예측 과제에서 성능이 열악한가?
주요 결과
- 랜덤 포레스트와 결정 트리 모델이 테스트된 모든 모델 중에서 가장 높은 예측 정확도를 달성했다.
- 투표, 배깅, 스태킹과 같은 앙상블 방법은 개별 모델을 뛰어넘는 뛰어난 성능을 보였다.
- 서포트 벡터 회귀(SVR)는 데이터 내 복잡한 비선형 패턴을 분리하는 데 어려움을 겪어 일관되게 낮은 성능을 보였다.
- 라소 회귀 역시 높은 차원 또는 노이즈가 많은 시계열 데이터에 민감한 점 때문에 성능이 열악했다.
- 인공 신경망(ANN)은 잘 수행되어 패닉 예측에서 딥러닝의 잠재력을 보여주었다.
- MAE, MSE, RMSE, MAPE 평가 지표는 랜덤 포레스트와 앙상블 모델이 모든 지표에서 가장 낮은 오차율을 기록함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.