[论文解读] Kernel Stein Tests for Multiple Model Comparison
本文提出了两种非参数统计检验方法——RelPSI 和 RelMulti,用于在 $ l > 2 $ 个候选模型中进行多模型比较,分别控制假阳性率(FPR)和错误发现率(FDR)。通过使用基于核函数的差异度量(MMD 或 KSD),并利用事后选择推断或多重校正来校正选择偏差,这些检验方法在保持良好误差控制的同时实现了较高的真正命中率(true positive rate),优于基于原始差异度分数的朴素选择方法。
We address the problem of non-parametric multiple model comparison: given $l$ candidate models, decide whether each candidate is as good as the best one(s) or worse than it. We propose two statistical tests, each controlling a different notion of decision errors. The first test, building on the post selection inference framework, provably controls the number of best models that are wrongly declared worse (false positive rate). The second test is based on multiple correction, and controls the proportion of the models declared worse but are in fact as good as the best (false discovery rate). We prove that under appropriate conditions the first test can yield a higher true positive rate than the second. Experimental results on toy and real (CelebA, Chicago Crime data) problems show that the two tests have high true positive rates with well-controlled error rates. By contrast, the naive approach of choosing the model with the lowest score without correction leads to more false positives.
研究动机与目标
- 为解决在 $ l > 2 $ 个候选模型可用时的非参数多模型比较挑战。
- 控制模型选择中的决策错误,特别是由于参考模型(最优模型)的噪声选择所导致的假阳性与错误发现。
- 将相对拟合检验从成对比较(如 RelMMD)扩展到多模型场景,使用 MMD 和 KSD 等基于核函数的差异度量。
- 在因参考模型基于数据选择而产生选择偏差的条件下,提供误差控制的理论保证。
- 通过在多样化合成数据集和真实世界数据集上的实证验证,证明所提检验方法在保持高统计功效的同时,能有效控制误差率。
提出的方法
- 该方法选择差异度估计值最低的模型作为参考模型,将其视为比较基准。
- 对 $ l $ 个模型中的每一个,计算其与参考模型之间差异度的差值作为相对检验统计量。
- RelPSI 使用事后选择推断来控制假阳性数量(FPR),确保错误地将最优模型判定为较差的概率受到限制。
- RelMulti 应用多重校正(如 Benjamini-Hochberg 方法)来控制错误发现率(FDR),即错误判定为劣于最优模型的模型比例。
- 这些检验方法适用于以样本表示的模型(通过 MMD)或以未归一化密度函数表示的模型(通过 KSD),具有广泛适用性。
- 为 RelMulti-KSD 推导了渐近零抽样分布,支持有效推断,并在 $ l=2 $ 时恢复为两样本相对检验的特殊情况。
实验结果
研究问题
- RQ1我们能否在保持统计严谨性的前提下,将相对拟合检验从成对比较扩展到多模型场景?
- RQ2当参考模型基于数据选择时,如何控制因引入选择偏差而导致的假阳性率?
- RQ3在多模型比较中,控制错误发现率(FDR)是否比控制家庭误差率(FPR)具有更高的统计功效?
- RQ4在何种条件下,事后选择推断(RelPSI)相比多重校正(RelMulti)能获得更高的真正命中率?
- RQ5与基于原始差异度分数的朴素模型选择相比,所提检验方法在实证中表现如何?
主要发现
- RelPSI 控制假阳性率(FPR),RelMulti 控制错误发现率(FDR),两者在适当条件下均具有可证明的理论保证。
- 在高斯混合模型问题中,RelPSI 的真正命中率(TPR)始终高于 RelMulti,验证了定理 4.1 的理论界。
- 在 RBM 实验中,基于 KSD 的检验方法实现了最高的 TPR,表明当模型以未归一化密度表示时,使用 KSD 具有显著优势。
- 在均值偏移实验中,RelPSI 和 RelMulti 在不同扰动水平下均保持了受控的 FPR 和 FDR,显示出对模型相似性的鲁棒性。
- 基于最低差异度分数选择模型的朴素方法导致了显著更多的假阳性,凸显了校正的必要性。
- 实证结果表明,RelMulti 在使用 50% 数据用于选择、50% 用于测试时,实现了受控的 FDR 和高 TPR;而增加用于选择的数据比例会因用于测试的数据减少而导致统计功效下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。