[論文レビュー] Chi-square and classical exact tests often wildly misreport significance; the remedy lies in computers
この論文は、モデル確率がほぼゼロに近い場合、古典的カイ二乗検定および正確検定がほぼゼロで除算されることにより、しばしば著しく不正確なp値を生じることを示している。本稿では、これらの検定を、現代の計算リソースを活用して最適化された二乗平均平方根統計量および対数尤度比統計量に置き換えることを提案する。これらは、特に現代の計算リソースを活用した場合、より強力で信頼性が高く、離散適合度検定に適している。
If a discrete probability distribution in a model being tested for goodness-of-fit is not close to uniform, then forming the Pearson chi-square statistic can involve division by nearly zero. This often leads to serious trouble in practice -- even in the absence of round-off errors -- as the present article illustrates via numerous examples. Fortunately, with the now widespread availability of computers, avoiding all the trouble is simple and easy: without the problematic division by nearly zero, the actual values taken by goodness-of-fit statistics are not humanly interpretable, but black-box computer programs can rapidly calculate their precise significance.
研究の動機と目的
- モデル確率が非常に小さい場合に、古典的カイ二乗検定および正確検定に内在する根本的な欠陥を暴露すること。これは、ほぼゼロで除算することに起因する。
- この欠陥が、数値丸め誤差が存在しない場合ですら、統計的パワーを著しく損なうことを示すこと。
- 従来のカイ二乗検定を、二乗平均平方根統計量やG²統計量といった計算的に実行可能な代替統計量に置き換えるよう提言すること。
- 現代のコンピュータが、これらの改善された統計量の正確な有意水準を精密に計算可能にすることを示すこと。
- 二乗平均平方根統計量およびG²統計量が、小さい確率を伴う離散適合度検定において、カイ二乗統計量よりも収束が速く、より強力であることを確立すること。
提案手法
- 離散のビンごとの実証的確率分布とモデル確率分布の差を測るため、二乗平均平方根(RMS)統計量を用いる。
- 対数尤度比統計量(G²)を補足的代替統計量として適用し、対数変換によってほぼゼロで除算する問題を軽減する。
- モデルがパrameter化されている場合、最大尤度推定(MLE)を用いてモデルパラメータを推定する。
- 各検定統計量の正確な有意水準を推定するために、1ケースあたり800,000回のモンテカルロシミュレーションを実施する。
- Zipf、幾何分布、ポアソン分布、ハリー=ヴァインベルグ分布など、複数の離散分布において、RMS、χ²、G²、フレイマン=トゥーキー統計量の収束速度を比較する。
- 帰無仮説の下で漸近的に一様になるように、信頼水準を計算するためのパラメトリックブートストラップに類似した手順を用いる。これにより、妥当な推論が保証される。
実験結果
リサーチクエスチョン
- RQ1古典的カイ二乗統計量におけるほぼゼロでの除算が、適合度検定の正確性とパワーにどのように影響するか?
- RQ2大標本漸近論において、二乗平均平方根、χ²、G²、フレイマン=トゥーキー統計量の収束速度を比較するとどうなるか?
- RQ3RMSおよびG²統計量のコンピュータで最適化された有意水準は、古典的カイ二乗検定を上回る統計的パワーと正確性を達成できるか?
- RQ4真の分布がモデル族に含まれる場合、MLEで推定されたモデルからの信頼水準の挙動はいかなるものか?
- RQ5さまざまな離散分布、特に重尾または極端に偏った確率を持つ分布において、異なる検定統計量はどのように性能を発揮するか?
主な発見
- 古典的カイ二乗統計量は、モデル確率がほぼゼロに近い場合、数値誤差が存在しない場合ですら、ほぼゼロで除算することに起因して、著しくパワーを失う。
- テストされたすべての分布において、二乗平均平方根統計量は、χ²、G²、フレイマン=トゥーキー統計量よりも、漸近的有意水準に早く収束する。
- 100ビン、θ = 5/2のZipf分布において、二乗平均平方根統計量は、標本サイズが増加するにつれて、真の有意水準に最も速く収束した。
- 20ビンの2パラメータモデルにおいて、二乗平均平方根統計量とχ²統計量は、G²およびフレイマン=トゥーキー統計量よりも早く収束し、二乗平均平方根統計量が最も効率的であった。
- MLEとシミュレーションを用いた提案手法により計算された信頼水準は、帰無仮説の下で分布として(0,1)上に一様に収束するため、妥当な推論が保証される。
- 二乗平均平方根統計量およびG²統計量は、スパarsなビンを伴う離散モデルにおいて、カイ二乗統計量よりもより頑健で強力である。特に、カテゴリ間で確率が大きくばらつく場合に顕著である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。