Skip to main content
QUICK REVIEW

[논문 리뷰] Predictive Analysis of COVID-19 Time-series Data from Johns Hopkins University

Alireza M. Javid, Xinyue Liang|arXiv (Cornell University)|2020. 05. 07.
Machine Learning and ELM참고 문헌 6인용 수 9
한 줄 요약

이 논문은 존스홉킨스대학교에서 제공하는 시계열 데이터를 활용하여 코로나19 확진자 수를 예측하는 모델을 제안한다. 비정상성 문제를 다루기 위해 슬라이딩 윈도우 방식을 적용하고, 다항 회귀와 극단적 학습 기계(ELM)를 사용한다. ELM 모델은 다항 회귀보다 뛰어난 성능을 보이며, 1일 예측의 평균 예측 오차가 1% 이하, 7일 예측의 평균 오차가 3.5% 이하로 나타나 12개국에서 높은 정확도를 확보한다. 매일 모델을 재학습함으로써 안정성과 정확도가 크게 향상된다.

ABSTRACT

We provide a predictive analysis of the spread of COVID-19, also known as SARS-CoV-2, using the dataset made publicly available online by the Johns Hopkins University. Our main objective is to provide predictions of the number of infected people for different countries in the next 14 days. The predictive analysis is done using time-series data transformed on a logarithmic scale. We use two well-known methods for prediction: polynomial regression and neural network. As the number of training data for each country is limited, we use a single-layer neural network called the extreme learning machine (ELM) to avoid over-fitting. Due to the non-stationary nature of the time-series, a sliding window approach is used to provide a more accurate prediction.

연구 동기 및 목표

  • 존스홉킨스대학교에서 공개하는 시계열 데이터를 활용해 근거리 코로나19 확진자 수를 예측한다.
  • 전염병의 사례 데이터가 비정상적임을 고려하여 슬라이딩 윈도우 방식을 적용한다.
  • 단기 예측에서 다항 회귀와 극단적 학습 기계(ELM)의 성능을 비교한다.
  • 예측 안정성과 정확도 향상에 있어 매일 모델을 재학습하는 영향을 평가한다.
  • 제한된 데이터를 가진 국가를 대상으로 실용적인 예측을 제공하며, 1일, 3일, 7일, 14일 예측에 초점을 맞춘다.

제안 방법

  • 입력은 누적 확진자 수의 최근 w일 간의 데이터로 구성되며, w는 예측 성능을 최적화하기 위해 교차 검증을 통해 선정된다.
  • 다항 회귀 모델은 슬라이딩 윈도우 크기 w에 대해 局부적으로 3차 다항식을 피팅하여 향후 사례를 예측한다.
  • 극단적 학습 기계(ELM)는 입력 가중치를 무작위로 초기화하고 ReLU 활성화 함수를 사용하는 단일층 신경망으로, 정규화된 최소 제곱 목표를 최소화한다.
  • 모델 파라미터는 변화하는 추세에 적응하고 예측 안정성을 향상시키기 위해 매일 최신 데이터 윈도우를 사용하여 재학습된다.
  • 예측 함수는 $ \hat{y}_{n+\tau} = f(\mathbf{y}_{n}) $ 로 정의되며, 여기서 $ f $ 는 슬라이딩 윈도우 크기 w로 학습된 다항식 또는 ELM 모델이다.
  • ELM 프레임워크에서 출력 가중치를 결정하기 위해 프로베니우스 노름 정규화 최적화 문제 $ \mathbf{O}^\star = \arg\min_{\mathbf{O}} \sum_{n=1}^{N} \|\mathbf{t}_n - \mathbf{O}\mathbf{z}_n\|^2_2 + \lambda\|\mathbf{O}\|^2_F $ 가 해결된다.

실험 결과

연구 질문

  • RQ1다항 회귀와 ELM 모델이 존스홉킨스대학교에서 제공하는 시계열 데이터만을 사용해 미래의 코로나19 확진자 수를 얼마나 정확하게 예측할 수 있는가?
  • RQ2다양한 국가에서 발생 동력이 다른 상황을 고려할 때 예측 오차를 최소화하는 최적의 슬라이딩 윈도우 크기 w는 무엇인가?
  • RQ3예측 모델을 매일 재학습하는 것이 시간이 지남에 따라 예측 정확도와 안정성 향상에 뚜렷한 영향을 미치는가?
  • RQ4다양한 예측 수준(1일, 3일, 7일, 14일)에서 다항 회귀와 ELM 모델의 예측 오차는 어떻게 변화하는가?
  • RQ5제한된 학습 데이터를 가진 다수의 국가에서 다항 회귀와 ELM 중 어느 모델이 더 일관되고 신뢰할 수 있는 예측을 제공하는가?

주요 결과

  • 5월 20일 기준 스웨덴에서 ELM 모델은 1일 예측 평균 오차가 0.5%였고 덴마크에서는 0.2%였으며, 인도와 미국를 제외한 모든 국가에서 1% 이하의 오차를 기록했다.
  • 7일 예측에서는 ELM 모델이 낮은 오차율을 유지했으며, 스웨덴에서 평균 오차 1.6%, 핀란드에서 1.4%였고, 이ран과 인도를 제외한 모든 국가에서 3.6% 이하였다.
  • 특히 장기 예측(7일 및 14일)에서 ELM 모델은 다항 회귀보다 뛰어난 일관성을 보였으며, 프랑스와 미국와 같은 국가에서는 다항 회귀의 오차가 크게 증가하는 경향을 보였다.
  • 매일 모델을 재학습하는 것이 낮고 안정적인 예측 오차를 유지하는 데 핵심적인 역할을 했으며, 정적 모델은 시간이 지남에 따라 급격히 성능이 떨어졌다.
  • 14일 예측의 평균 오차는 스웨덴에서 3.3%, 미국에서 11.3%였고, 이ран(10.4%)과 인도(33.9%)에서는 변동성이 높아 장기 예측의 과제를 보여주었다.
  • 일일 오차 퍼cent 히스토GRAM은 모든 예측 수준과 국가에서 ELM이 다항 회귀보다 더 좁은 오차 분포를 지속적으로 생성하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.