Skip to main content
QUICK REVIEW

[논문 리뷰] Prediction Regions for Poisson and Over-Dispersed Poisson Regression Models with Applications to Forecasting Number of Deaths during the COVID-19 Pandemic

Taeho Kim, Benjamin Lieberman|arXiv (Cornell University)|2020. 07. 04.
COVID-19 epidemiological studies참고 문헌 15인용 수 5
한 줄 요약

이 논문은 코로나19 팬데믹 동안 매일 및 누적 사망자를 예측하기 위해 포아송 분포 및 과분산 포아송 회귀 모델을 위한 예측 영역을 제안한다. 과분산을 고려한 프레일티 기반 과분산 포아송 모델을 도입하여 사망 데이터의 과도한 변동성을 반영하며, 재할당 조정이 적용된 경우 더 넓은 예측 구간을 보이며, 특히 2020년 7월 2일 이후로 점 예측값과 불확실성이 크게 증가하는 것으로 나타났다.

ABSTRACT

Motivated by the current Coronavirus Disease (COVID-19) pandemic, which is due to the SARS-CoV-2 virus, and the important problem of forecasting daily deaths and cumulative deaths, this paper examines the construction of prediction regions or intervals under the Poisson regression model and for an over-dispersed Poisson regression model. For the Poisson regression model, several prediction regions are developed and their performance are compared through simulation studies. The methods are applied to the problem of forecasting daily and cumulative deaths in the United States (US) due to COVID-19. To examine their performance relative to what actually happened, daily deaths data until May 15th were used to forecast cumulative deaths by June 1st. It was observed that there is over-dispersion in the observed data relative to the Poisson regression model. An over-dispersed Poisson regression model is therefore proposed. This new model builds on frailty ideas in Survival Analysis and over-dispersion is quantified through an additional parameter. The Poisson regression model is a hidden model in this over-dispersed Poisson regression model and obtains as a limiting case when the over-dispersion parameter increases to infinity. A prediction region for the cumulative number of US deaths due to COVID-19 by July 16th, given the data until July 2nd, is presented. Finally, the paper discusses limitations of proposed procedures and mentions open research problems, as well as the dangers and pitfalls when forecasting on a long horizon, with focus on this pandemic where events, both foreseen and unforeseen, could have huge impacts on point predictions and prediction regions.

연구 동기 및 목표

  • 코로나19 팬데믹 기간 동안 매일 및 누적 사망자에 대한 신뢰할 수 있는 예측 구간이 필요한 핵심 문제를 해결하기 위해.
  • 표준 포아송 가정을 위반하는 보고된 사망자 수의 과분산을 모델링하기 위해.
  • 과분산을 추가 파라미터로 측정하기 위해 프레일티 기반 난수 효과를 사용하는 융통성 있는 과분산 포아송 회귀 모델을 개발하기 위해.
  • 2020년 7월 2일까지의 데이터를 바탕으로 2020년 7월 16일까지의 누적 사망자에 대한 예측 영역을 구축하기 위해.
  • 데이터 재할당 및 모델 민감도가 예측 불확실성과 점 추정치에 미치는 영향을 평가하기 위해.

제안 방법

  • 시간 추세로 DayNum에 대한 5차 다항식을 사용하고, 주간 패턴을 반영하기 위해 요일 지표를 도입한다.
  • 과분산은 감마 분포를 따르는 프레일티 항목을 통해 모델링하는 과분산 포아송 회귀 모델을 도입하며, 분산 파라미터가 증가함에 따라 포아송 모델이 한계 경우가 된다.
  • 모든 모델에서 예측 구간을 구성하기 위해 포아송 분포에 대한 정규 근사법을 적용한다.
  • 포아송 및 과분산 포아송 가정 하에서 다양한 예측 영역 방법의 성능을 비교하기 위해 시뮬레이션 연구를 수행한다.
  • 각 일자의 예측 불확실성을 고려하여 일일 사망자 예측치를 누적합 전파 방식으로 조합하여 누적 사망자에 대한 예측 영역을 구축한다.
  • 지연되거나 수정된 보고로 인한 예측 정확도 및 구간 너비에 영향을 시뮬레이션하기 위해 데이터 재할당 조정을 시행한다.

실험 결과

연구 질문

  • RQ1포아송 및 과분산 포아송 가정 하에서 일일 사망자 수에 대한 다양한 예측 영역 방법의 성능은 어떻게 되는가?
  • RQ2미국 코로나19 사망자 수 보고치에 나타나는 과분산은 표준 포아송 회귀 모델을 얼마나 심각하게 무효화하는가?
  • RQ3데이터 재할당 조정은 누적 사망자에 대한 예측 구간의 너비와 위치에 어떤 영향을 미치는가?
  • RQ4예측 불확실성은 시간이 지남에 따라 어떻게 변화하는가, 특히 학습 기간 이후로는 어떻게 되는가?
  • RQ5프레일티 기반 과분산 포아송 모델은 팬데믹 예측에서 표준 포아송 모델에 비해 예측 신뢰도를 향상시킬 수 있는가?

주요 결과

  • 관측된 미국 코로나19 사망자 수 데이터는 표준 포아송 모델 대비 심각한 과분산을 보였으며, 이는 과분산 모델의 사용이 필수적임을 시사한다.
  • 데이터 재할당 조정이 적용된 경우, 2020년 7월 16일 누적 사망자에 대한 예측 구간이 더 넓어졌으며, 이는 보고 변경으로 인한 불확실성 증가를 반영한다.
  • 재할당이 이루어진 경우, 2020년 7월 16일 누적 사망자에 대한 점 추정치는 약간 높아졌으며, 이는 업데이트된 데이터 입력 반영을 반영한다.
  • 2020년 7월 2일 이후로 예측 기간이 연장될수록 예측 구간이 크게 넓어졌으며, 이는 장기 예측의 불확실성 증가를 반영한다.
  • 2020년 7월 2일 이후로 일일 사망자 예측 곡선은 이전의 감소 추세와는 대조적으로 상승 추세를 보이며, 정책 변화나 행동 변화의 영향일 수 있음을 시사한다.
  • 특히 뉴욕과 뉴저지에서 큰 재할당 사건이 발생함에 따라 모델이 이상치에 민감함을 보이며, 장기 예측의 한계를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.