[论文解读] The Power of Batching in Multiple Hypothesis Testing
本文提出了 Batch_BH 和 Batch_St-BH,这两种新颖的 FDR 控制算法,可在保持正式 FDR 控制的前提下,实现跨多个批次的顺序自适应假设检验。通过在批处理框架内重新应用 Benjamini-Hochberg 和 Storey-BH 程序,这些方法在统计功效上优于在线方法,且在 FDR 保证上强于简单批处理方法,弥合了离线与在线多重检验方法之间的差距。
One important partition of algorithms for controlling the false discovery rate (FDR) in multiple testing is into offline and online algorithms. The first generally achieve significantly higher power of discovery, while the latter allow making decisions sequentially as well as adaptively formulating hypotheses based on past observations. Using existing methodology, it is unclear how one could trade off the benefits of these two broad families of algorithms, all the while preserving their formal FDR guarantees. To this end, we introduce $ ext{Batch}_{ ext{BH}}$ and $ ext{Batch}_{ ext{St-BH}}$, algorithms for controlling the FDR when a possibly infinite sequence of batches of hypotheses is tested by repeated application of one of the most widely used offline algorithms, the Benjamini-Hochberg (BH) method or Storey's improvement of the BH method. We show that our algorithms interpolate between existing online and offline methodology, thus trading off the best of both worlds.
研究动机与目标
- 解决离线 FDR 方法的高统计功效与在线 FDR 方法的自适应性之间的权衡。
- 开发一种框架,用于在在线方式下控制无限序列假设检验批次的错误发现率。
- 在反复对每个批次应用离线 FDR 程序(如 BH 和 Storey-BH)时,保持正式的 FDR 控制,否则会导致 FDR 失控。
- 在保持对整个序列和单个批次的 FDR 控制的同时,实现基于历史结果的自适应假设生成。
- 提供一种方法,继承离线方法的稳定性与在线方法的顺序决策能力。
提出的方法
- 提出 Batch_BH 和 Batch_St-BH,作为在多个批次上对 Benjamini-Hochberg 和 Storey-BH 程序进行顺序组合的方法。
- 对每个批次独立应用 BH 和 Storey-BH 程序,使用逐批递减的显著性水平以维持整体的 FDR 控制。
- 采用 p 值序列的保守依赖性假设,以在一般条件下确保 FDR 控制。
- 通过条件期望和塔性质推导理论 FDR 边界,表明 FDR 控制在名义水平 α 的 max{1, δ} 倍以内。
- 引入校正项 ε_i,以考虑在原假设被拒绝或未被拒绝时预期发现数不平衡的潜在影响。
- 通过调整显著性水平的改进批处理程序,将框架扩展至处理正相关的 p 值。
实验结果
研究问题
- RQ1我们能否设计一种方法,将离线 FDR 程序的高功效与在线程序的自适应性相结合,用于顺序假设检验?
- RQ2是否可能在不违反 FDR 控制保证的前提下,反复在批次间应用离线 FDR 算法(如 BH 或 Storey-BH)?
- RQ3如何确保 FDR 控制不仅作用于整个检验序列,也作用于单个批次或子组?
- RQ4对于在在线环境中重用离线算法的批处理程序,可以建立怎样的 FDR 理论边界?
- RQ5在统计功效和 FDR 控制方面,所提出的批处理方法与纯粹的在线或离线 FDR 方法相比表现如何?
主要发现
- Batch_BH 和 Batch_St-BH 在整个检验序列和每个单独批次上均实现了正式的 FDR 控制,而简单地顺序应用离线方法则无法做到这一点。
- 所提方法的 FDR 受限于 max{1, δ} × α,其中 δ 是在原假设被拒绝与未被拒绝时预期发现数之比的上确界。
- 这些方法继承了离线程序的稳定性,因为其发现集对假设顺序不敏感,而在线方法则不然。
- 在合成数据上的实证结果表明,Batch_BH 和 Batch_St-BH 在保持 FDR 控制的同时,统计功效高于最先进的在线 FDR 方法。
- 该框架允许基于历史结果进行自适应假设生成,从而支持在大规模顺序测试(如工业中的 A/B 测试)中的应用。
- 这些算法已集成至 onlineFDR R 包中,展示了其实际可用性和实际采纳情况。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。