[论文解读] Two-sample Bayesian nonparametric goodness-of-fit test
本文提出了一种新颖的贝叶斯非参数两样本拟合优度检验,使用以标准正态分布为中心、浓度参数为1的近似狄利克雷过程样本之间的柯尔莫哥洛夫距离。该方法在所有检验场景中均表现出优于经典检验的统计功效,始终优于柯尔莫哥洛夫-斯米尔诺夫检验,并对狄利克雷过程参数的先验设定表现出稳健性。
In recent years, Bayesian nonparametric statistics has gathered extraordinary attention. Nonetheless, a relatively little amount of work has been expended on Bayesian nonparametric hypothesis testing. In this paper, a novel Bayesian nonparametric approach to the two-sample problem is established. Precisely, given two samples $\mathbf{X}=X_1,\ldots,X_{m_1}$ $\overset {i.i.d.} \sim F$ and $\mathbf{Y}=Y_1,\ldots,Y_{m_2} \overset {i.i.d.} \sim G$, with $F$ and $G$ being unknown continuous cumulative distribution functions, we wish to test the null hypothesis $\mathcal{H}_0:~F=G$. The method is based on the Kolmogorov distance and approximate samples from the Dirichlet process centered at the standard normal distribution and a concentration parameter 1. It is demonstrated that the proposed test is robust with respect to any prior specification of the Dirichlet process. A power comparison with several well-known tests is incorporated. In particular, the proposed test dominates the standard Kolmogorov-Smirnov test in all the cases examined in the paper.
研究动机与目标
- 开发一种贝叶斯非参数方法,用于在两样本设置下检验两个未知连续累积分布函数的相等性。
- 解决贝叶斯非参数假设检验方法的稀缺性问题,特别是针对两样本问题。
- 创建一种灵活、稳健且强大的替代方法,用于频繁统计非参数检验(如柯尔莫哥洛夫-斯米尔诺夫检验)。
- 通过模拟研究和与现有检验的统计功效比较,评估该方法的性能。
- 探索该检验对狄利克雷过程基测度和浓度参数变化的稳健性。
提出的方法
- 该方法使用以标准正态分布为基测度、浓度参数为1的狄利克雷过程的近似样本,来建模未知分布F和G。
- 计算两个样本的经验累积分布函数与其对应狄利克雷过程近似之间的柯尔莫哥洛夫距离。
- 检验统计量基于两个狄利克雷过程样本之间的距离,作为衡量两个分布差异的指标。
- 通过蒙特卡洛模拟近似p值,将观察到的距离与原假设下获得的距离进行比较。
- 该方法利用狄利克雷过程的渐近性质,确保在样本量增大时,距离在原假设下收敛于零。
- 通过改变基测度(例如,均匀分布与正态分布)和浓度参数(例如,a=1与a=50)来评估稳健性,结果在各种配置下保持一致。
实验结果
研究问题
- RQ1能否基于柯尔莫哥洛夫距离与狄利克雷过程近似,构建一种贝叶斯非参数两样本检验?
- RQ2与经典的非参数检验(如柯尔莫哥洛夫-斯米尔诺夫检验)相比,所提出的检验在统计功效上表现如何?
- RQ3所提出的检验对狄利克雷过程的基测度和浓度参数变化是否具有稳健性?
- RQ4该方法是否能避免传统频繁统计检验中p值常导致的对原假设证据的过度估计问题?
- RQ5该方法能否推广至多变量或右删失数据的情形?
主要发现
- 在本文研究的所有模拟场景中,所提出的贝叶斯非参数检验在统计功效上始终优于标准的柯尔莫哥洛夫-斯米尔诺夫检验。
- 该检验对狄利克雷过程基测度的变化具有稳健性;当基测度从标准正态分布切换为均匀分布(a=1)时,距离和p值(U)保持不变。
- 将浓度参数从a=1增加到a=50会降低距离和p值(U),但检验结论保持不变,表明对这一参数具有稳健性。
- 该方法不依赖于传统频繁统计中p值的解释,可能缓解对原假设证据的过度估计问题。
- 渐近理论支持该检验的有效性,因为在样本量增加时,柯尔莫哥洛夫距离在原假设下收敛于零。
- 该方法具有灵活性,适用于任何两样本问题,无论样本量大小,且不依赖于基于经验累积分布函数的分布自由假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。