[论文解读] Post hoc inference via joint family-wise error rate control
本文提出了一种用户无关的后选推理框架,通过控制联合族错误率(JER),为任何数据驱动选择的假设集提供有效的统计保证,即使在数据窥探后依然成立。通过利用逐步下降程序和依赖感知校准,该方法确保了所有可能的拒绝集上一致的 I 类错误控制,将高偏差检验和闭合检验方法统一在 JER 控制框架下。
We introduce a general methodology for post hoc inference in a large-scale multiple testing framework. The approach is called "user-agnostic" in the sense that the statistical guarantee on the number of correct rejections holds for any set of candidate items selected by the user (after having seen the data). This task is investigated by defining a suitable criterion, named the joint-family-wise-error rate (JER for short). We propose several procedures for controlling the JER, with a special focus on incorporating dependencies while adapting to the unknown quantity of signal (via a step-down approach). We show that our proposed setting incorporates as particular cases a version of the higher criticism as well as the closed testing based approach of Goeman and Solari (2011). Our theoretical statements are supported by numerical experiments.
研究动机与目标
- 解决大规模多重检验中的事后选择推断问题,因为选择偏差的存在,标准程序会失效。
- 为任何用户选择的假设集中的假阳性数量提供统计保证,无论使用何种选择规则。
- 开发一种能够适应未知信号大小并考虑检验统计量之间依赖关系的方法。
- 将现有方法如高偏差检验和闭合检验统一在基于联合族错误率(JER)控制的统一框架下。
- 确保所有可能选择集 R 上的一致有效性,使推断对任意数据窥探具有鲁棒性。
提出的方法
- 引入联合族错误率(JER)作为准则,以控制任意选择集 R 中假阳性数量超过界限 V(R) 的概率。
- 提出一种逐步下降程序,根据零假设 p 值的顺序统计量分布自适应校准拒绝阈值。
- 采用基于重采样的校准方法,通过可交换置换构造一个有效且数据依赖的边界 λ(α,X,H₀),以在水平 α 下控制 JER。
- 通过在零假设集 H₀ 上条件化并利用置换不变性,将检验统计量之间的依赖关系纳入考虑,以推导有效的 p 值比较。
- 采用基于模板的框架,其中边界 V(R) 由参考阈值族和 p 值顺序统计量推导得出。
- 应用 Simes 不等式和置换对称性,推导出在任意选择规则下依然有效的保守边界。
实验结果
研究问题
- RQ1能否构建一种事后推理程序,使得对任何数据驱动选择的集合 R 都能提供有效的错误控制,而不论选择规则如何?
- RQ2如何在不假设独立性的情况下,将检验统计量之间的依赖关系纳入事后推理?
- RQ3所提出的方法能否在单一 JER 控制框架下统一现有方法,如高偏差检验和闭合检验?
- RQ4确保所有可能拒绝集上一致 I 类错误控制的最小校准程序是什么?
- RQ5该逐步下降程序如何在未知信号大小的情况下自适应调整,同时保持强错误控制?
主要发现
- 所提出的方法在所有可能的选择集 R 上实现了联合族错误率(JER)的一致控制,确保 P(∀R ⊆ {1,…,m}: |H₀ ∩ R| ≤ V(R)) ≥ 1−α。
- JER 控制框架推广了高偏差检验方法和 Goeman 与 Solari(2011)提出的闭合检验程序,将其作为特例包含在内。
- 逐步下降程序通过利用零假设集中 p 值的顺序统计量,自适应地估计真实零假设的数量,从而在稀疏信号设置下提升检验效能。
- 基于重采样的校准方法通过利用置换后检验统计量的可交换性,确保在任意依赖结构下的有效性。
- 数值实验验证了该方法的有效性,并展示了其在具有复杂选择规则的高维设置下的实际应用价值。
- 当选择规则为任意或自适应时,该方法依然保持有效性,因此适用于探索性数据分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。