Skip to main content
QUICK REVIEW

[論文レビュー] Testing Case Number of Coronavirus Disease 2019 in China with Newcomb-Benford Law

Junyi Zhang|arXiv (Cornell University)|Feb 13, 2020
Benford’s Law and Fraud Detection参考文献 5被引用数 11
ひとこと要約

本研究は、統計的手法としてのニューカム=ベンフォードの法則(NBL)を用いて、中国のCOVID-19累積症例数の整合性を検証する。92.8%のp値が得られ、初期流行段階における報告症例数にデータ操作の統計的証拠がないことを示唆している。

ABSTRACT

The coronavirus disease 2019 bursted out about two months ago in Wuhan has caused the death of more than a thousand people. China is fighting hard against the epidemics with the helps from all over the world. On the other hand, there appear to be doubts on the reported case number. In this article, we propose a test of the reported case number of coronavirus disease 2019 in China with Newcomb-Benford law. We find a $p$-value of $92.8\%$ in favour that the cumulative case numbers abide by the Newcomb-Benford law. Even though the reported case number can be lower than the real number of affected people due to various reasons, this test does not seem to indicate the detection of frauds.

研究の動機と目的

  • 初期流行段階における中国のCOVID-19報告累積症例数の統計的整合性を評価すること。
  • 症例データの最初の有効数字の分布がニューカム=ベンフォードの法則(NBL)に従うかどうかを特定すること。
  • 観察されたデータパターンが、データの捏造や操作の可能性を示唆するかどうかを評価すること。
  • NBLが疫学的統計における異常を検出するためのツールとしての適用可能性を検討すること。

提案手法

  • 本研究は、中国の31の省レベル行政区分の累積確認症例数の最初の有効数字にニューカム=ベンフォードの法則(NBL)を適用する。
  • 観測された桁数頻度とNBLの期待値を比較するために、カイ二乗検定統計量 $ V = \sum_{d=1}^{9} \frac{(N(d) - N_{\text{tot}} P_{\text{NB}}(d))^2}{N_{\text{tot}} P_{\text{NB}}(d)} $ を使用する。
  • 帰無仮説 $ H_0 $ は、データがNBLに従うことを想定し、改ざんがないことを示唆する。対立仮説は、混合モデル $ \Pi = (1-\tau)\Psi + \tau\Phi $ を介して改ざんの可能性を含む。
  • 2020年1月15日から2月10日までに収集された628件のデータポイントを、Wikipediaから公開されたデータを用いて分析する。
  • 観測された分布と期待されるNBL分布の適合度を評価するため、92.8%のp値を計算する。

実験結果

リサーチクエスチョン

  • RQ1中国が報告した累積COVID-19症例数の最初の有効数字の分布は、ニューカム=ベンフォードの法則に従うか?
  • RQ2初期流行段階における報告症例数に、統計的改ざんの証拠があるか?
  • RQ3ニューカム=ベンフォードの法則は、疫学的症例データにおける異常を検出するのに信頼性を持って適用可能か?
  • RQ4公衆衛生の文脈において、初期段階の指数関数的増加データにNBLテストを適用した場合、その結果はどの程度頑健か?

主な発見

  • カイ二乗検定統計量は $ V = 3.10 $ を得ており、これに対応するp値は92.8%である。
  • 高いp値は、ニューカム=ベンフォードの法則との強い適合性を示し、帰無仮説(データが期待される桁数分布に従う)を支持する。
  • 本研究期間中の中国のCOVID-19累積症例数に、統計的改ざんの証拠はない。
  • NBLは系統的な過小報告を検出できないため、医療資源の制限による潜在的な報告不足やバイアスは、NBLでは特定されない。
  • 結果から、NBLは疫学的データの整合性を事前のスクリーニングに有用なツールとして活用できる可能性があるが、すべての種類のデータバイアスを検出するものではない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。