Skip to main content
QUICK REVIEW

[論文レビュー] Two samples test for discrete power-law distributions

Alessandro Bessi|arXiv (Cornell University)|Mar 2, 2015
Complex Network Analysis Techniques参考文献 7被引用数 9
ひとこと要約

本稿では、離散的設定におけるコルモゴロフ=スミルノフ検定の限界を補うために、2つの離散的サンプルが同一のパワー則分布から抽出されたかどうかを判定する、対数尤度比に基づく統計的検定を提案する。帰無仮説の下で、検定統計量は自由度1のカイ二乗分布に従い、スケーリングパラメータの等価性に関する信頼性の高い推論を可能にする。

ABSTRACT

Power-law distributions occur in wide variety of physical, biological, and social phenomena. In this paper, we propose a statistical hypothesis test based on the log-likelihood ratio to assess whether two samples of discrete data are drawn from the same power-law distribution.

研究の動機と目的

  • 同一起因のタイ(同一値)と近似p値の問題により、離散的パワー則分布に対してコルモゴロフ=スミルノフ検定が不適切であるという問題を解決すること。
  • 離散的パワー則データに特化した形式的な統計的仮説検定を開発すること。
  • 2つのサンプルが同一の潜在的パワー則分布から抽出されたかどうかを評価できるようにすること。
  • 最尤推定を用いてスケーリングパラメータを推定し、それらのパラメータの等価性を検定する手法を提供すること。

提案手法

  • 帰無仮説(プールドサンプルの尤度)と対立仮説(個別サンプルの尤度)の両方を用いた尤度比検定を定式化する。
  • 離散的パワー則分布におけるスケーリングパラメータαの最尤推定器(MLE)を用い、次の近似式を適用する:$\hat{\alpha} \simeq 1 + n \left[ \sum_{i=1}^{n} \ln \frac{x_i}{x_{\text{min}} - \frac{1}{2}} \right]^{-1}$。
  • 検定統計量 $\Lambda = -2 \times l(H_0|s_1 \cup s_2) + 2 \times (l(H_1|s_1) + l(H_1|s_2))$ を計算し、帰無仮説の下で漸近的に $\chi^2(1)$ 分布に従うことを確認する。
  • 離散的パワー則の確率質量関数を定義するために、一般化されたゼータ関数 $\zeta(\alpha, x_{\text{min}}) = \sum_{n=0}^{\infty} (n + x_{\text{min}})^{-\alpha}$ を用いる。
  • 尾部の挙動の可視化および分析的評価に、補完的累積分布関数 $P(x) = \frac{\zeta(\alpha, x)}{\zeta(\alpha, x_{\text{min}})}$ を適用する。
  • 真の事実が既知の2つのシミュレーション例を用いて検証:1つは同じ分布からのサンプル、もう1つは異なる分布からのサンプル。

実験結果

リサーチクエスチョン

  • RQ1信頼性のある統計的検定を用いて、2つの離散的サンプルが同一のパワー則分布から抽出されたかどうかを判定できるか?
  • RQ2提案された対数尤度比検定は、同一の分布と異なる分布からのサンプルを区別する際に、どの程度の性能を示すか?
  • RQ3スケーリングパラメータが等しいという帰無仮説の下で、検定統計量の漸近的分布は何か?
  • RQ4離 discrete データに対して、コルモゴロフ=スミルノフ検定と比較して、本検定は有効性と正確性において優れているか?
  • RQ5スケーリングパラメータが異なるα値を持つパワー則分布から生成されたサンプルにおいて、本検定はパrameterの差をどの程度の精度で検出できるか?

主な発見

  • 例1では、$\alpha = 2$ のパワー則分布からサイズ $10^5$ の2つのサンプルを抽出したが、検定統計量 $\Lambda = 0.0065$ でp値が0.936となり、帰無仮説は採択された。
  • 例2では、$\alpha_1 = 2$ と $\alpha_2 = 2.05$ のパワー則分布からサンプルを抽出したが、検定統計量 $\Lambda = 149.49$ でp値が $< 10^{-3}$ となり、帰無仮説は棄却された。
  • 最初の例ではスケーリングパラメータの推定値が $\hat{\alpha}_{s_1} = 1.997852$ および $\hat{\alpha}_{s_2} = 1.99816$ となり、真の $\alpha = 2$ と非常に近い値であった。
  • 2番目の例では、$\hat{\alpha}_{s_1} = 2.003242$ および $\hat{\alpha}_{s_2} = 2.051032$ となり、明確な差が検出された。
  • 帰無仮説の下で、検定統計量 $\Lambda$ は漸近的に $\chi^2(1)$ 分布に従うことが確認され、有意性検定への適用が妥当であることが裏付けられた。
  • 本手法は、中程度のサンプルサイズでもスケーリングパラメータの差を効果的に検出でき、2番目の例では高い統計的パワーを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。