Skip to main content
QUICK REVIEW

[논문 리뷰] Data-driven Identification of Number of Unreported Cases for COVID-19: Bounds and Limitations

Ajitesh Srivastava, Viktor K. Prasanna|arXiv (Cornell University)|2020. 06. 03.
Anomaly Detection Techniques and Applications참고 문헌 9인용 수 4
한 줄 요약

이 논문은 안정된 사회적 거리두기 단계 동안의 전염병 데이터를 활용하여, 보고되지 않은 코로나19 감염자 수의 상한선을 추정하기 위한 데이터 기반 방법인 고정 감염률 학습을 제안한다. 특정 시간 창 내에서 보고 확률을 신뢰성 있게 학습할 수 있음을 증명함으로써, 실제 감염자 수 대비 보고된 감염자 수의 비율에 대한 상한선을 제시한다. 뉴욕에서는 이 비율이 35배 이하, 일리노이에서는 40배 이하, 매사추세츠에서는 38배 이하, 뉴저지에서는 29배 이하로 추정되며, 높은 신뢰도를 가진다.

ABSTRACT

Accurate forecasts for COVID-19 are necessary for better preparedness and resource management. Specifically, deciding the response over months or several months requires accurate long-term forecasts which is particularly challenging as the model errors accumulate with time. A critical factor that can hinder accurate long-term forecasts, is the number of unreported/asymptomatic cases. While there have been early serology tests to estimate this number, more tests need to be conducted for more reliable results. To identify the number of unreported/asymptomatic cases, we take an epidemiology data-driven approach. We show that we can identify lower bounds on this ratio or upper bound on actual cases as a factor of reported cases. To do so, we propose an extension of our prior heterogeneous infection rate model, incorporating unreported/asymptomatic cases. We prove that the number of unreported cases can be reliably estimated only from a certain time period of the epidemic data. In doing so, we construct an algorithm called Fixed Infection Rate method, which identifies a reliable bound on the learned ratio. We also propose two heuristics to learn this ratio and show their effectiveness on simulated data. We use our approaches to identify the upper bounds on the ratio of actual to reported cases for New York City and several US states. Our results demonstrate with high confidence that the actual number of cases cannot be more than 35 times in New York, 40 times in Illinois, 38 times in Massachusetts and 29 times in New Jersey, than the reported cases.

연구 동기 및 목표

  • 보고되지 않은 또는 무증상 감염자로 인해 장기적인 전염병 예측이 신뢰할 수 없게 되는 문제를 다루기 위해.
  • 보고 확률을 최소한의 오차로 신뢰성 있게 추정할 수 있는, 전염병 데이터 내에서 신뢰할 수 있는 시간 창을 식별하기 위해.
  • 격리 효과가 알려지지 않은 상태에서도 실제 감염자 수 대비 보고된 감염자 수의 비율에 대해 보장된 상한선을 제공하는 방법을 개발하기 위해.
  • 미국 주들에서의 실제 데이터를 바탕으로 제안된 방법의 성능을 평가하고, 히우리스틱 대안과 비교하기 위해.

제안 방법

  • 보고된 감염자 수 대비 실제 감염자 수의 비율을 나타내는 매개변수를 포함하는 이전의 이질적 감염률 모델을 확장한다.
  • 전염병의 초기 불안정성 이후, 후기 단계의 역학 변화 이전의 특정 시간 간격을 식별하여, 이 기간 동안 보고 확률을 신뢰성 있게 추정할 수 있음을 확인한다.
  • 고정 감염률 학습 알고리즘을 제안하며, 이는 이 시간 창 내에서 데이터의 안정성을 활용하여 보고 확률의 하한선을 계산하고, 그에 따라 총 감염자 수의 상한선을 도출한다.
  • 이론적 보장이 없는 두 가지 히우리스틱—비선형 점진적 학습과 비선형 곡선 피팅—을 도입하여 상한선을 추정한다.
  • 보고 확률과 인구의 격리 효과(γ̄ = (1−ρ)γ)의 조합을 대체 지표로 사용하며, 여기서 ρ는 완전히 격리된 인구 비율이다.
  • 뉴욕 시티와 여러 미국 주들에서의 실제 데이터에 이 방법을 적용하여, 통계적 검정과 신뢰구간을 활용해 결과의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1사회적 거리두기 단계 동안의 전염병 데이터로부터 보고되지 않은 코로나19 감염자 수에 대한 신뢰할 수 있는 상한선를 유도할 수 있는가?
  • RQ2모델의 초기 불안정성과 후기 단계의 역학 변화를 고려할 때, 보고 확률을 가장 정확하게 추정할 수 있는 전염병의 시간 창은 언제인가?
  • RQ3격리된 사람(전파나 보고를 하지 않는 사람)의 존재가 보고 확률의 학습 가능성과 총 감염자 수에 대한 상한선에 어떤 영향을 미치는가?
  • RQ4제안된 방법이 실제 감염자 수의 상한선을 추정하는 데 있어 히우리스틱 대안보다 얼마나 더 우수한가?
  • RQ5이 방법은 다른 전염병 모델로 일반화 가능하며, 전파 경향이 이질적인 지역에 적용 가능할 수 있는가?

주요 결과

  • 뉴욕의 실제 코로나19 감염자 수는 보고된 수의 35배를 초과할 수 없다는 높은 신뢰도를 가진다.
  • 일리노이에서는 총 감염자 수의 상한선이 보고된 수의 40배 이하이다.
  • 매사추세츠에서는 총 감염자 수의 상한선이 보고된 수의 38배 이하이다.
  • 뉴저지에서는 총 감염자 수의 상한선이 보고된 수의 29배 이하이다.
  • 네 주 모두 통계적 검정(Test1 및 Test2)을 통과하여 추정된 상한선의 신뢰성은 확인되었다.
  • 로스앤젤레스에서는 메서드의 성능이 일관되지 않았으며, 95% 신뢰구간이 타당한 범위를 벗어나 있어, 이곳에서는 아직 상한선을 신뢰성 있게 추정하기에는 너무 이르다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.