Skip to main content
QUICK REVIEW

[논문 리뷰] Testing Case Number of Coronavirus Disease 2019 in China with Newcomb-Benford Law

Junyi Zhang|arXiv (Cornell University)|2020. 02. 13.
Benford’s Law and Fraud Detection참고 문헌 5인용 수 11
한 줄 요약

이 연구는 뉴컴브-벤포르드 법칙(NBL)을 사용하여 코로나19 초기 유행 단계 동안 중국이 보고한 누적 확진자 수의 무결성을 검증한다. NBL은 데이터 조작을 탐지하기 위한 통계적 방법이다. 연구 결과, p-값이 92.8%로 나타나 NBL와 강한 일치를 보이며, 초기 유행 단계 동안 보고된 확진자 수에 통계적으로 조작의 증거가 없음을 시사한다.

ABSTRACT

The coronavirus disease 2019 bursted out about two months ago in Wuhan has caused the death of more than a thousand people. China is fighting hard against the epidemics with the helps from all over the world. On the other hand, there appear to be doubts on the reported case number. In this article, we propose a test of the reported case number of coronavirus disease 2019 in China with Newcomb-Benford law. We find a $p$-value of $92.8\%$ in favour that the cumulative case numbers abide by the Newcomb-Benford law. Even though the reported case number can be lower than the real number of affected people due to various reasons, this test does not seem to indicate the detection of frauds.

연구 동기 및 목표

  • 코로나19 유행 초기 단계 동안 중국이 보고한 누적 확진자 수의 통계적 무결성을 평가하기 위해.
  • 확진자 수의 첫 번째 유효 숫자 분포가 뉴컴브-벤포르드 법칙(NBL)을 따르는지 확인하기 위해.
  • 관찰된 데이터 패턴이 잠재적 데이터 위조 또는 조작을 시사하는지 평가하기 위해.
  • 유행 통계에서 이질성을 탐지하기 위한 NBL의 적용 가능성을 탐색하기 위해.

제안 방법

  • 연구는 중국의 31개 성급 행정구역에서의 누적 확진자 수의 첫 번째 유효 숫자에 대해 뉴컴브-벤포르드 법칙(NBL)을 적용한다.
  • 観측된 숫자 빈도와 NBL 기대값을 비교하기 위해 카이제곱 검정 통계량 $ V = \sum_{d=1}^{9} \frac{(N(d) - N_{\text{tot}} P_{\text{NB}}(d))^2}{N_{\text{tot}} P_{\text{NB}}(d)} $ 를 사용한다.
  • 귀무가설 $ H_0 $ 는 데이터가 NBL을 따르며, 이는 조작이 없다는 것을 의미한다; 대립가설은 혼합모형 $ \Pi = (1-\tau)\Psi + \tau\Phi $ 을 통한 잠재적 조작을 포함한다.
  • 2020년 1월 15일부터 2월 10일까지의 공개 데이터를 위키피디아에서 확보한 628개 데이터 포인트를 대상으로 검정을 수행한다.
  • 관측된 분포와 기대되는 NBL 분포 간의 적합도를 평가하기 위해 p-값 92.8% 를 계산한다.

실험 결과

연구 질문

  • RQ1중국이 보고한 누적 코로나19 확진자 수의 첫 번째 유효 숫자 분포는 뉴컴브-벤포르드 법칙을 따르는가?
  • RQ2유행의 초기 단계 동안 보고된 확진자 수에 통계적 조작 또는 위조의 증거가 있는가?
  • RQ3뉴컴브-벤포르드 법칙은 유행 사례 데이터의 이질성을 탐지하기 위해 신뢰성 있게 적용될 수 있는가?
  • RQ4공중보건 맥락에서 폭발적 증가 단계의 초기 단계 데이터에 NBL 검정이 얼마나 강인한가?

주요 결과

  • 카이제곱 검정 통계량은 $ V = 3.10 $ 으로 도출되었으며, 이는 p-값 92.8% 와 대응한다.
  • 높은 p-값은 NBL과의 강한 일치를 나타내며, 귀무가설 즉, 데이터가 기대되는 숫자 분포를 따르는 것을 지지한다.
  • 연구 기간 동안 중국의 코로나19 누적 확진자 수에 통계적으로 조작의 증거가 없다.
  • NBL은 체계적 저수치를 탐지할 수 없기 때문에, 의료 자원 부족으로 인한 잠재적 저수치나 편향은 검토하지 못한다.
  • 결과는 NBL이 유행 데이터의 무결성에 대한 初期 감시 도구로 유용할 수 있음을 시사하지만, 모든 형태의 데이터 편향을 탐지하는 데에는 확정적이지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.