Skip to main content
QUICK REVIEW

[論文レビュー] Goodness of fit statistics for sparse contingency tables

Audrey Finkler|arXiv (Cornell University)|Jun 11, 2010
Sensory Analysis and Statistical Methods参考文献 9被引用数 4
ひとこと要約

本稿では、ゼロセルを含むスパースな列交叉表における適合度検定のためのピアソンのカイ二乗(Q)およびカルバックのG統計量の修正版を提案する。修正は、小さなセル確率の低評価を是正し、漸近的にカイ二乗分布を維持しながら、スパースデータにおける第一種および第二種の誤り率を改善する。モンテカルロシミュレーションによる検証と、生態学的・疫学的データへの応用が行われた。

ABSTRACT

Statistical data is often analyzed as a contingency table, sometimes with empty cells called zeros. Such sparse tables can be due to scarse observations classified in numerous categories, as for example in genetic association studies. Thus, classical independence tests involving Pearson's chi-square statistic Q or Kullback's minimum discrimination information statistic G cannot be applied because some of the expected frequencies are too small. More generally, we consider goodness of fit tests with composite hypotheses for sparse multinomial vectors and suggest simple corrections for Q and G that improve and generalize known procedures such as Ku's. We show that the corrected statistics share the same asymptotic distribution as the initial statistics. We produce Monte Carlo estimations for the type I and type II errors on a toy example. Finally, we apply the corrected statistics to independence tests on epidemiologic and ecological data.

研究の動機と目的

  • 古典的なカイ二乗統計量およびG統計量がゼロセルを含むスパースな列交叉表で有効でないという限界を解消する。
  • 期待度数が0.5未満のスパースな多項分布データにおける第一種および第二種の誤り率を改善する。
  • GおよびQ統計量のスパースな表に対するクーの補正法を一般化・改善する。
  • 帰無仮説の下で、修正統計量が元の統計量と同一の漸近的カイ二乗分布を保持することを保証する。
  • 高次元スパースな表において、フィッシャーの正確確率検定やセルの統合を回避する実用的で頑健な代替手法を提供する。

提案手法

  • 列交叉表内のゼロセル数$c$を補正するための修正統計量$ Q^{ab} $および$ G^{ab} $を提案する。
  • 最尤推定量$ p^* $を、ゼロセル頻度を非ゼロセルに尤度に基づく割り当て方式で再分配することにより修正する。
  • ゼロセル頻度の制約下で尤度を最大化するように保証するため、尤度の不等式を用いる。
  • 帰無仮説$ H_0: p = p^0(\theta) $の下で、合成適合度仮説を検定するために修正統計量$ Q^{ab} $および$ G^{ab} $を適用する。
  • ビーアの正則性条件を拡張し、$ H_0 $の下での分布収束を証明することで、漸近的$ \chi^2_{R-s-1} $分布を保持する。
  • 第一種および第二種の誤り率を評価するため、$ R=18 $、$ c=7 $、$ s=17 $のトイ例におけるモンテカルロシミュレーションにより手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1ピアソンのカイ二乗統計量およびカルバックのG統計量は、ゼロセルを含むスパースな列交叉表でどのように修正すれば妥当性を保てるか?
  • RQ2修正統計量$ Q^{ab} $および$ G^{ab} $は、元の統計量と同一の漸近的カイ二乗分布を保持するか?
  • RQ3提案された修正が、スパースな多項分布データにおける第一種および第二種の誤り率に与える影響は何か?
  • RQ4修正統計量は、フィッシャーの正確確率検定やセルの統合といった既存の手法と比較して、実世界の生態学的・疫学的データでどのように性能を発揮するか?
  • RQ5古典的検定が失敗する高次元スパースな表において、修正統計量は信頼性を持って関連性を検出できるか?

主な発見

  • 修正統計量$ Q^{ab} $および$ G^{ab} $は、帰無仮説の下で、元の$ Q $および$ G $と同一の漸近的$ \chi^2_{R-s-1} $分布を維持する。
  • $ R=18 $、$ c=7 $、$ s=17 $の$ 3 \times 6 $表におけるモンテカルロシミュレーションでは、誤り率の制御が改善され、$ Q^{ab}=20.68 $および$ G^{ab}=26.05 $が$ \chi^2_{0.95,10}=18.31 $の臨界値を超えた。
  • 生態学的データ例では、$ G^{ab} $および$ Q^{ab} $の両方が帰無仮説を棄却し、栄養段階と植生組成の間に有意な関連があることを示した。
  • 修正統計量は、希少種がオligotrophicな川を好むのに対し、汚染耐性種がエウトロフィック環境に優位に存在することを検出しており、生態的パターンを確認した。
  • 期待度数が0.5未満の表に対しても効果的に対処でき、セルの統合や計算コストの高いフィッシャーの正確確率検定の必要を回避した。
  • 理論的証明により、ゼロセル数$ C_n $が標本サイズの増加に伴いほとんど確実に0に収束することが示され、修正の漸近的妥当性を支持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。