Skip to main content
QUICK REVIEW

[論文レビュー] Predictive Analysis of COVID-19 Time-series Data from Johns Hopkins University

Alireza M. Javid, Xinyue Liang|arXiv (Cornell University)|May 7, 2020
Machine Learning and ELM参考文献 6被引用数 9
ひとこと要約

本稿では、ジョンズ・ホプキンス大学の時系列データを用いて、非定常性を扱うスライディングウィンドウ手法を適用し、多項回帰と極端な学習機械(ELM)を用いたCOVID-19の症例数予測モデルを提案する。ELMモデルは多項回帰を上回り、1日予測では平均予測誤差が1%未満、7日予測では3.5%未塔を記録し、12か国で実現された。毎日のモデル再訓練は安定性と精度を顕著に向上させた。

ABSTRACT

We provide a predictive analysis of the spread of COVID-19, also known as SARS-CoV-2, using the dataset made publicly available online by the Johns Hopkins University. Our main objective is to provide predictions of the number of infected people for different countries in the next 14 days. The predictive analysis is done using time-series data transformed on a logarithmic scale. We use two well-known methods for prediction: polynomial regression and neural network. As the number of training data for each country is limited, we use a single-layer neural network called the extreme learning machine (ELM) to avoid over-fitting. Due to the non-stationary nature of the time-series, a sliding window approach is used to provide a more accurate prediction.

研究の動機と目的

  • ジョンズ・ホプキンス大学が提供する公開の時系列データを用いて、近い将来のCOVID-19の症例数を予測すること。
  • パンデミック症例データの非定常性に対処するため、スライディングウィンドウ手法を用いること。
  • 短期予測において、多項回帰と極端な学習機械(ELM)の性能を比較すること。
  • 予測の安定性と精度に与える毎日のモデル再訓練の影響を評価すること。
  • 限られたデータを持つ国に対して、実用的な予測を提供することを目的とし、1日、3日、7日、14日予測に焦点を当てる。

提案手法

  • 入力は、累積確認例数の直近w日分であり、wは交差検証により予測性能を最適化するように選定される。
  • 多項回帰モデルは、スライディングウィンドウサイズwの局所的3次多項式フィッティングを用い、将来の症例数を予測する。
  • 極端な学習機械(ELM)は、ランダムに初期化された入力重みとReLU活性化関数を備えた1層ニューラルネットワークとして用いられ、正則化された最小二乗法の目的関数を最小化する。
  • モデルパラメータは、変化するトレンドに適応し、予測の安定性を向上させるために、毎日最新のデータウィンドウを用いて再訓練される。
  • 予測関数は $ \hat{y}_{n+\tau} = f(\mathbf{y}_{n}) $ で定義され、ここで $ f $ はスライディングウィンドウサイズwで訓練された多項式またはELMモデルである。
  • 出力重みを決定するため、Frobeniusノルム正則化最適化問題 $ \mathbf{O}^\star = \arg\min_{\mathbf{O}} \sum_{n=1}^{N} \|\mathbf{t}_n - \mathbf{O}\mathbf{z}_n\|^2_2 + \lambda\|\mathbf{O}\|^2_F $ が解かれる。

実験結果

リサーチクエスチョン

  • RQ1ジョンズ・ホプキンス大学の時系列データのみを用いて、多項回帰とELMモデルが、将来のCOVID-19症例数をどの程度正確に予測できるか?
  • RQ2多様な国々で異なる流行動態を示す状況下で、予測誤差を最小化する最適なスライディングウィンドウサイズwは何か?
  • RQ3予測モデルを毎日再訓練することで、時間経過に伴う予測精度と安定性が顕著に向上するか?
  • RQ4多項回帰とELMモデルの両方において、予測期間(1日、3日、7日、14日)ごとの予測誤差はどのように変化するか?
  • RQ5限られたトレーニングデータを持つ複数の国において、多項回帰とELMのどちらのモデルがより一貫性があり信頼性の高い予測を提供するか?

主な発見

  • 5月20日時点で、スウェーデンでは1日予測の平均予測誤差が0.5%、デンマークでは0.2%に達し、インドとアメリカを除き、すべての国で1%未塔の誤差を記録した。
  • 7日予測では、ELMモデルは低誤差率を維持し、スウェーデンでは平均誤差1.6%、フィンランドでは1.4%を記録し、インドとイランを除き、すべての国で3.6%未塔であった。
  • 特に7日および14日予測のような長期予測において、ELMモデルは多項回帰に比べて優れた一貫性を示した。フランスやアメリカのような国では、多項回帰の誤差が顕著に増加した。
  • 毎日のモデル再訓練は、予測誤差を低く安定させるために不可欠であることが判明した。静的モデルは時間の経過とともに著しく性能を低下させた。
  • 14日予測の平均誤差は、スウェーデンで3.3%、アメリカで11.3%であった。イラン(10.4%)やインド(33.9%)のような国では、高いばらつきが見られ、長期予測の困難さが示された。
  • 1日ごとの誤差パcentのヒストグラムは、すべての予測期間と国において、ELMが多項回帰よりもタイトな誤差分布を一貫して生成していることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。