Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive County Level COVID-19 Forecast Models: Analysis and Improvement

Stewart W. Doe, Tyler Russell Seekins|arXiv (Cornell University)|2020. 06. 16.
COVID-19 epidemiological studies참고 문헌 19인용 수 4
한 줄 요약

이 논문은 CLEIR-Net을 제안하며, LSTM 기반 백본을 통해 국가 수준의 시간 패턴을 학습하고, 시간에 따라 분포된 밀도층을 적용하여 14일 간의 개별 카운티 변화를 예측함으로써 카운티 수준의 코로나19 확진자 수를 예측하는 경량이며 계층적인 순환 신경망을 개발한다. 이는 적응형 TDEFSI-LONLY 모델을 능가하며, 중앙 예측 MSE가 75,707로 TDEFSI의 1,800만에 비해 유의미하게 낮게 유지되며, 훨씬 적은 파라미터를 사용하고 학습 효율성과 일반화 능력을 향상시킨다.

ABSTRACT

Accurately forecasting county level COVID-19 confirmed cases is crucial to optimizing medical resources. Forecasting emerging outbreaks pose a particular challenge because many existing forecasting techniques learn from historical seasons trends. Recurrent neural networks (RNNs) with LSTM-based cells are a logical choice of model due to their ability to learn temporal dynamics. In this paper, we adapt the state and county level influenza model, TDEFSI-LONLY, proposed in Wang et a. [l2020] to national and county level COVID-19 data. We show that this model poorly forecasts the current pandemic. We analyze the two week ahead forecasting capabilities of the TDEFSI-LONLY model with combinations of regularization techniques. Effective training of the TDEFSI-LONLY model requires data augmentation, to overcome this challenge we utilize an SEIR model and present an inter-county mixing extension to this model to simulate sufficient training data. Further, we propose an alternate forecast model, {\it County Level Epidemiological Inference Recurrent Network} (\alg{}) that trains an LSTM backbone on national confirmed cases to learn a low dimensional time pattern and utilizes a time distributed dense layer to learn individual county confirmed case changes each day for a two weeks forecast. We show that the best, worst, and median state forecasts made using CLEIR-Net model are respectively New York, South Carolina, and Montana.

연구 동기 및 목표

  • 제한된 데이터와 높은 차원성으로 인해 카운티 수준의 코로나19 확진자 수를 예측하는 데 도전하는 데 목적을 두며.
  • 기존 인플루엔자에 대해 설계된 TDEFSI-LONLY 모델을 변형하여 코로나19 팬데믹 예측에 활용하고자 한다.
  • 국가 수준의 추세를 활용하여 지역 예측에 정보를 제공함으로써 파라미터 효율적인 아키텍처를 설계하여 과적합과 학습 시간을 줄이고자 한다.
  • 카운티 간 혼합 SEIR 모델을 사용하여 데이터 증강을 통해 일반화 능력을 향상시키고자 한다.

제안 방법

  • 기존에 인플루엔자 예측을 위해 설계된 TDEFSI-LONLY 모델을 변형하여, LSTM 셀을 사용하는 순환 신경망을 활용해 카운티 수준의 코로나19 확진자 수를 예측한다.
  • 표준 SEIR 모델에 카운티 간 유입 및 유출 항목을 추가하여, 팬데믹 기간 동안의 현실적인 카운티 간 이동성을 시뮬레이션함으로써 데이터 증강을 구현한다.
  • 국가 확진자 수에서 저차원의 국가 시간 패턴을 학습하는 LSTM 백본을 갖춘 이중 브랜치 아키텍처인 CLEIR-Net을 제안한다.
  • 14일 예측 기간 동안의 개별 카운티 확진자 수 변화를 국가 신호에서 매핑하기 위해 시간에 따라 분포된 밀도층을 사용한다.
  • 모의 데이터에서 일반화 능력 향상과 과적합 감소를 위해 TDEFSI 모델에 드롭아웃 및 동적 손실 항목과 같은 정규화 기법을 적용한다.
  • 2020년 5월 18일부터 31일까지의 실제 카운티 수준 데이터를 기반으로 모델을 학습하고 평가하며, 평균 제곱오차(MSE)를 사용해 성능을 비교한다.

실험 결과

연구 질문

  • RQ1원래 인플루엔자 예측을 위해 설계된 TDEFSI-LONLY 모델이 이동성 모델링이 없고 코로나19에 맞게 수정되지 않은 상태에서도 카운티 수준의 코로나19 확진자 수를 효과적으로 예측할 수 있는가?
  • RQ2다양한 정규화 기법은 제한된 실세계 데이터에서 적응형 TDEFSI 모델의 일반화 능력과 예측 정확도에 어떤 영향을 미치는가?
  • RQ3CLEIR-Net과 같은 새로운 계층적 RNN 아키텍처가 예측 정확도와 파라미터 효율성 측면에서 적응형 TDEFSI 모델을 능가할 수 있는가?
  • RQ4SEIR 모델에 카운티 간 혼합을 통합함으로써 합성 학습 데이터의 현실성과 유용성이 얼마나 향상되는가?
  • RQ5공유된 LSTM 백본을 통해 국가 수준의 시간 패턴을 활용함으로써 지역 카운티 수준의 예측 성능이 향상되는가?

주요 결과

  • CLEIR-Net은 미국 전역의 카운티에서 중앙 예측 MSE가 75,707로 나타나, 적응형 TDEFSI 모델의 MSE 18,798,679보다 유의미하게 뛰어나 성능을 냈다.
  • CLEIR-Net에서 가장 우수한 성능을 보인 예측은 뉴욕(이상제곱오차 = 7,090)이었고, 가장 열악한 성능은 샌드프론스카운티(이상제곱오차 = 188,677)였으며, 이는 강한 지역 성능 변동성을 보였다.
  • CLEIR-Net의 최고 성능 버전은 단 10,945개의 파라미터만을 사용한 반면, 적응형 TDEFSI 모델은 1,038,405개의 파라미터를 사용하여 모델 복잡도가 크게 감소함을 보여주었다.
  • 정규화 기법을 적용한 TDEFSI 모델은 일반화 능력이 향상되었지만 여전히 단순 변화 없음 기준선보다 열등했으며, 이는 코로나19 역학에 대한 적응성이 부족함을 시사했다.
  • 드롭아웃 정규화 기법은 TDEFSI의 국가 수준 예측 성능을 향상시켰고, 네 번째 예측 기간 이후에는 단순 기준선을 초월했지만, 카운티 수준의 예측 정확도는 확보하지 못했다.
  • 제안된 카운티 간 혼합 SEIR 모델은 데이터 증강의 현실성을 향상시켜, 제한된 실세계 카운티 수준 데이터에도 불구하고 RNN의 학습을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.