Skip to main content
QUICK REVIEW

[论文解读] Asynchronous Online Testing of Multiple Hypotheses

Tijana Zrnic, Aaditya Ramdas|arXiv (Cornell University)|Dec 12, 2018
Machine Learning and Algorithms参考文献 33被引用 15
一句话总结

本文提出了一种新颖的异步在线多重假设检验框架,在测试统计量存在局部依赖的情况下控制错误发现率(FDR),通过冲突集抽象来管理依赖关系。该框架提出了如 SAFFRON$_{\text{dep}}$ 和 LORD$_{\text{dep}}$ 等算法,在去中心化、重叠测试环境中保持形式化的 FDR 控制,且在现实依赖结构下展现出更高的统计功效。

ABSTRACT

We consider the problem of asynchronous online testing, aimed at providing control of the false discovery rate (FDR) during a continual stream of data collection and testing, where each test may be a sequential test that can start and stop at arbitrary times. This setting increasingly characterizes real-world applications in science and industry, where teams of researchers across large organizations may conduct tests of hypotheses in a decentralized manner. The overlap in time and space also tends to induce dependencies among test statistics, a challenge for classical methodology, which either assumes (overly optimistically) independence or (overly pessimistically) arbitrary dependence between test statistics. We present a general framework that addresses both of these issues via a unified computational abstraction that we refer to as "conflict sets." We show how this framework yields algorithms with formal FDR guarantees under a more intermediate, local notion of dependence. We illustrate our algorithms in simulations by comparing to existing algorithms for online FDR control.

研究动机与目标

  • 解决在实时、去中心化及重叠假设检验流中错误发现率(FDR)控制的挑战。
  • 在异步在线检验中对测试统计量之间的依赖关系进行建模与管理,避免对独立性或任意依赖关系的过度乐观或过度悲观假设。
  • 提出统一的计算抽象——'冲突集',以实现在更现实的局部依赖结构下的形式化 FDR 控制。
  • 设计实用算法(如 SAFFRON$_{\text{dep}}$、LORD$_{\text{dep}}$),在异步环境中保持 FDR 控制的同时最大化统计功效。
  • 在具有局部依赖的真实世界数据(如 IMPC 数据库中的高通量表型筛选数据)上验证该框架。

提出的方法

  • 引入'冲突集'作为计算抽象,用于表示测试之间的重叠依赖关系,其中每个测试的显著性水平仅取决于先前已完成的测试。
  • 定义局部依赖条件:对每个测试 $t$,存在有限的 $L_t$,使得 $P_t$ 与 $P_s$ 对于 $s > t + L_t$ 独立,捕捉时间衰减的依赖关系。
  • 将 SAFFRON 和 LORD 在线 FDR 程序适配以引入冲突集,根据先前发现和依赖结构动态调整显著性水平。
  • 通过将 PRDS(正回归依赖于子集)条件扩展至异步设置,推导出在局部依赖下的理论 FDR 控制保证。
  • 采用 alpha-investing 的小批量变体,以提升大规模测试流中的计算效率,同时保持 FDR 控制。
  • 使用基于财富的框架,其中测试显著性水平通过跟踪错误发现预算的'财富'变量进行动态调整,并在每次测试后更新。

实验结果

研究问题

  • RQ1当测试统计量为局部依赖而非独立或任意依赖时,是否能在异步在线多重检验中实现形式化的 FDR 控制?
  • RQ2如何利用'冲突集'这类计算抽象来建模和管理去中心化、重叠测试流中的依赖关系?
  • RQ3在异步与同步在线 FDR 程序之间,统计功效与时间效率的权衡关系如何?
  • RQ4在局部依赖条件下,所提出的算法(SAFFRON$_{\text{dep}}$、LORD$_{\text{dep}}$)与现有方法相比在实践中表现如何?
  • RQ5具有时间相关假设的真实世界数据(如 IMPC 小鼠表型数据)在多大程度上表现出局部依赖?该框架能否有效处理此类结构?

主要发现

  • 所提出的框架在局部依赖假设下实现了形式化的 FDR 控制,该假设比独立性或任意依赖更符合异步检验中的实际情况。
  • 在模拟和具有局部依赖的真实数据上,SAFFRON$_{\text{dep}}$ 和 LORD$_{\text{dep}}$ 在统计功效方面优于标准 alpha-支出法和基线在线 FDR 方法。
  • 在 IMPC 小鼠表型数据集的实验中,SAFFRON$_{\text{dep}}$ 在 $\lambda=0.1$ 时,于所有目标 FDR 水平下均比 LORD$_{\text{dep}}$ 和 alpha-支出法做出更多发现,展现出更高的功效。
  • 仿真和真实世界案例研究均表明,即使测试在时间上重叠且共享数据,该框架仍能保持 FDR 控制。
  • mFDR(修正的 FDR)估计值在模拟中紧密跟踪 FDR,验证了理论保证,并显示出在有限样本中的稳健性。
  • 冲突集的使用实现了高效、去中心化的决策,无需协调正在进行的测试,使该方法可扩展至大规模实时应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。