[论文解读] Chi-square and classical exact tests often wildly misreport significance; the remedy lies in computers
本文表明,当模型概率接近零时,经典卡方检验和确切检验常因除以接近零的数而导致p值严重不准确。本文提出用计算机优化的均方根和对数似然比统计量替代这些检验,这些统计量在现代计算资源下更具功效和可靠性。
If a discrete probability distribution in a model being tested for goodness-of-fit is not close to uniform, then forming the Pearson chi-square statistic can involve division by nearly zero. This often leads to serious trouble in practice -- even in the absence of round-off errors -- as the present article illustrates via numerous examples. Fortunately, with the now widespread availability of computers, avoiding all the trouble is simple and easy: without the problematic division by nearly zero, the actual values taken by goodness-of-fit statistics are not humanly interpretable, but black-box computer programs can rapidly calculate their precise significance.
研究动机与目标
- 揭示当模型概率极小时,经典卡方检验和确切检验的根本缺陷,即因除以接近零的数而导致的问题。
- 证明该缺陷即使在无数值舍入误差的情况下,也严重削弱统计功效。
- 主张用计算上可行的替代方法(如均方根和G²统计量)替代传统的卡方检验。
- 展示现代计算机可精确计算这些改进统计量的精确显著性水平。
- 确立均方根和G²统计量在小概率离散拟合优度检验中收敛更快、功效更强于卡方检验。
提出的方法
- 使用均方根(RMS)统计量衡量离散区间上经验概率分布与模型概率分布之间的差异。
- 采用对数似然比统计量(G²)作为互补替代方法,通过对数变换缓解除以接近零数的问题。
- 当模型参数化时,使用最大似然估计(MLE)估计模型参数。
- 使用蒙特卡洛模拟(每种情况800,000次模拟)估计每种检验统计量的精确显著性水平。
- 在多种离散分布(如齐普夫分布、几何分布、泊松分布、哈迪-温伯格分布等)下,比较RMS、χ²、G²和弗里曼-图克统计量的收敛速度。
- 使用类似参数自 resampling 的程序,计算在原假设下渐近均匀的置信水平,以确保有效推断。
实验结果
研究问题
- RQ1经典卡方统计量中因除以接近零的数,如何影响拟合优度检验的准确性和功效?
- RQ2在大样本渐近条件下,均方根、χ²、G²和弗里曼-图克统计量的收敛速度如何比较?
- RQ3计算机优化的RMS和G²统计量的显著性水平能否在统计功效和准确性方面优于经典卡方检验?
- RQ4当真实分布属于模型族时,基于MLE估计模型的置信水平行为如何?
- RQ5在各种离散分布下,特别是重尾或高度偏斜概率的分布下,不同检验统计量的表现如何?
主要发现
- 当模型概率接近零时,经典卡方统计量因除以接近零的数而出现严重功效损失,即使在无数值误差的情况下也是如此。
- 在所有测试的分布中,均方根统计量比χ²、G²和弗里曼-图克统计量更快收敛到其渐近显著性水平。
- 在100个区间的齐普夫分布且θ = 5/2时,随着样本量增加,均方根统计量对真实显著性水平的收敛速度最快。
- 在20个区间的两参数模型中,均方根和χ²统计量的收敛速度快于G²和弗里曼-图克统计量,且均方根最为高效。
- 通过所提方法(使用MLE和模拟)计算的置信水平在原假设下收敛于(0,1)上的均匀分布,确保了有效推断。
- 在稀疏区间且各类别概率差异显著的离散模型中,均方根和G²统计量比χ²更具稳健性和功效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。