[論文レビュー] Gibrat's law for cities: uniformly most powerful unbiased test of the Pareto against the lognormal
この論文は、米国都市のサイズがZipfの法則(指数1のパレート分布)に従うか、または対数正規分布に従うかという論争を、Census 2000データを用いて一様に最も powerful な不偏検定(UMPUT)を適用することで解決する。最大1,000都市のサイズは、1.4 ± 0.1の尾指数を有するパレート分布に従い、90%信頼水準でZipfの法則を棄却する。一方、より小さな都市は対数正規分布によってよりよく記述される。これにより、以前の矛盾する研究が統合される。
We address the general problem of testing a power law distribution versus a log-normal distribution in statistical data. This general problem is illustrated on the distribution of the 2000 US census of city sizes. We provide definitive results to close the debate between Eeckhout (2004, 2009) and Levy (2009) on the validity of Zipf's law, which is the special Pareto law with tail exponent 1, to describe the tail of the distribution of U.S. city sizes. Because the origin of the disagreement between Eeckhout and Levy stems from the limited power of their tests, we perform the {\em uniformly most powerful unbiased test} for the null hypothesis of the Pareto distribution against the lognormal. The $p$-value and Hill's estimator as a function of city size lower threshold confirm indubitably that the size distribution of the 1000 largest cities or so, which include more than half of the total U.S. population, is Pareto, but we rule out that the tail exponent, estimated to be $1.4 \pm 0.1$, is equal to 1. For larger ranks, the $p$-value becomes very small and Hill's estimator decays systematically with decreasing ranks, qualifying the lognormal distribution as the better model for the set of smaller cities. These two results reconcile the opposite views of Eeckhout (2004, 2009) and Levy (2009). We explain how Gibrat's law of proportional growth underpins both the Pareto and lognormal distributions and stress the key ingredient at the origin of their difference in standard stochastic growth models of cities \cite{Gabaix99,Eeckhout2004}.
研究の動機と目的
- 米国都市のサイズがパレート分布(Zipfの法則)か対数正規分布かをめぐる、Eeckhout(2004)とLevy(2007)の長年の論争を解決すること。
- 特にパレート分布と対数正規分布の尾部の差を検出する能力が限られていた過去の検定の統計的パワーの限界を是正すること。
- 一様に最も powerful な不偏検定(UMPUT)を用いて、パレート分布の帰無仮説を、対数正規分布の対立仮説と比較して、明確に評価すること。
- パレート分布の尾指数が1(すなわちZipfの法則が成立する)かどうか、それとも顕著に異なるかを、厳密な統計的推論を用いて特定すること。
提案手法
- 著者らは、パレート分布の帰無仮説を、対数正規分布の対立仮説と比較する一様に最も powerful な不偏検定(UMPUT)を適用する。
- 下限の都市サイズを変化させた場合のUMPUTのp値を計算するために、鞍点近似を用い、小標本に対しても高い正確性を確保する。
- Hillの推定量を用いてパレート尾指数の逆数(α⁻¹)を推定し、UMPUTから得られる信頼区間を用いて統計的有意性を評価する。
- モンテカルロシミュレーションを用いて、UMPUTの結果の妥当性を検証し、p値および推定量の挙動の頑健性を確認する。
- 検定は、都市のサイズを最大から最小へ順位付けた米国国勢調査2000年のデータに適用され、下限の閾値を変化させることで尾部の挙動を評価する。
- 本手法は、Eeckhoutのモデルに一致するパrameters μ=7.28 および σ=1.25 を持つ対数正規分布からのシミュレーテッドデータと、実証的結果を比較する。
実験結果
リサーチクエスチョン
- RQ1米国上位都市のサイズ分布は、パレート分布か対数正規分布のどちらによってよりよく記述されるか。その統計的証拠は何か?
- RQ2米国都市サイズのパレート分布の尾指数が1(すなわちZipfの法則が成立する)かどうか、それとも顕著に異なるか?
- RQ3過去の研究がLilliefors検定(L検定)や他の手法を用いて、都市サイズの分布形について矛盾した結論に至ったのはなぜか?
- RQ4パレート分布と対数正規分布の漸近的尾部挙動はどのように異なり、それらは実証データで区別可能か?
- RQ5Gibratの比例成長法則は、パレート分布と対数正規分布の両方を生成するのに果たす役割は何か。また、尾指数≠1のパレート尾を生成するには、どのような追加仮定が必要か?
主な発見
- 一様に最も powerful な不偏検定(UMPUT)は、米国上位1,000都市のサイズ分布がパレート分布に従うことを確認し、下限の閾値を下げてもp値が高く維持されることから、この範囲でパレートモデルに強い支持が得られることを示している。
- 尾指数αは1.4 ± 0.1と推定され、これは1とは顕著に異なるため、90%信頼水準でZipfの法則は棄却される。
- 都市の順位が1,000を超える領域では、p値が急激に低下し、対数正規分布がより良い適合を示している。
- Hillの推定量による逆尾指数(α⁻¹)は、上位1,000都市では約0.7としてほぼ一定に保たれ、安定したパレート尾を確認するが、より高い順位では体系的に低下し、パレート行動からの逸脱を示唆する。
- μ=7.28、σ=1.25のパラメータを持つシミュレーテッド対数正規データでは、Hill推定量にプラトーが観察されない。これにより、米国データの実証的挙動は、上尾部において対数正規分布とは整合しないことが確認される。
- 本研究の結果は、Eeckhout(2004)の対数正規分布の結論とLevy(2007)のパレート分布の結論を統合する。上位都市群ではパレートモデルが成立し、一方、全体および小規模都市群では対数正規モデルがより適切である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。