[论文解读] Generic E-Variables for Exact Sequential k-Sample Tests that allow for Optional Stopping
本文提出适用于精确、非渐近 k-样本顺序检验的通用 E-变量,可在可选停止和继续的情况下保持第一类错误控制。通过构建分块 E-变量并将其乘入检验鞅,该方法在灵活的采样设计下确保了有效的推断,当使用相对 GRO 先验时,在备择假设下具有最优增长特性,相较于 p 值方法在早期停止场景中表现更优,同时保持错误控制。
We develop E-variables for testing whether two or more data streams come from the same source or not, and more generally, whether the difference between the sources is larger than some minimal effect size. These E-variables lead to exact, nonasymptotic tests that remain safe, i.e. keep their type-I error guarantees, under flexible sampling scenarios such as optional stopping and continuation. In special cases our E-variables also have an optimal 'growth' property under the alternative. While the construction is generic, we illustrate it through the special case of k x 2 contingency tables, where we also allow for the incorporation of different restrictions on a composite alternative. Comparison to p-value analysis in simulations and a real-world example show that E-variables, through their flexibility, often allow for early stopping of data collection, thereby retaining similar power as classical methods, while also retaining the option of extending or combining data afterwards.
研究动机与目标
- 开发适用于 k-样本比较的精确、非渐近假设检验,即使在灵活采样(包括可选停止和继续)下仍保持有效性。
- 确保无论停止规则如何,第一类错误控制均成立,即使数据收集基于观测结果自适应调整。
- 提出一种适用于任意指数族和散度度量的通用 E-变量构造方法,实现广泛适用性。
- 通过增长速率最优(GRO)先验优化备择假设下的检验效能,尤其在 k×2 列联表设定中表现突出。
- 通过模拟和真实案例展示,E-变量可在与经典 p 值方法相当的检验效能下实现更早停止。
提出的方法
- 为两个或多个组的单个数据块构造 E-变量,确保在原假设下 E[s] ≤ 1。
- 通过将分块 E-变量相乘构建测试鞅,使其在可选停止下仍保持为有效的 E-变量。
- 在备择假设空间上使用先验分布定义 E-变量,其选择影响检验效能但不影响第一类错误控制。
- 应用相对 GRO(相对增长速率最优)准则选择在备择假设下期望增长最大的先验。
- 对于 k×2 列联表,基于共轭先验和分块采样推导 E-变量,允许对效应大小 δ 施加限制。
- 使用 E-值作为检验统计量:若乘积超过 1/α,则拒绝原假设,确保水平为 α 的错误控制。
实验结果
研究问题
- RQ1能否为 k-样本顺序检验通用构造 E-变量,使其在可选停止下仍保持第一类错误控制?
- RQ2在备择假设下,备择假设空间上先验的选择如何影响 E-变量的增长速率与检验效能?
- RQ3在应用可选停止时,E-变量在早期停止与检验效能方面如何优于 p 值方法?
- RQ4能否构造在备择假设下具有最优增长特性的 E-变量,尤其在 k×2 列联表设定中?
- RQ5基于 Gunel-Dickey 贝叶斯因子的 E-变量是否在原假设下仍为有效 E-变量?若否,原因是什么?
主要发现
- 通过分块乘法构造的 E-变量在可选停止下仍能保持第一类错误控制,即使数据收集基于历史结果自适应调整。
- 模拟结果表明,E-变量可在与费舍尔精确检验相当的检验效能下实现更早停止,而 p 值方法在可选停止下则出现第一类错误膨胀。
- 基于独立多项分布采样方案与均匀先验(β = 1/2)的 E-变量在原假设下满足 E[s] ≤ 1,符合 E-变量条件。
- 泊松采样方案下的 Gunel-Dickey 贝叶斯因子不满足 E-变量资格,因其在原假设下的期望值在 λ ≥ 1 时超过 1。
- 对于独立多项分布情形,数值模拟证实,贝叶斯因子在各种 θ 和 n_g 下的期望值在原假设下超过 1,因此不满足 E-变量资格。
- 在可选停止下,E-变量的第一类错误率稳定控制在 α = 0.05 以内,而费舍尔 p 值方法的错误率随时间显著上升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。