Skip to main content
QUICK REVIEW

[论文解读] Sequential Tests of Multiple Hypotheses Controlling False Discovery and Nondiscovery Rates

Jay Bartroff, Jinlin Song|arXiv (Cornell University)|Nov 14, 2013
Statistical Methods in Clinical Trials参考文献 52被引用 11
一句话总结

本文提出顺序BH程序,一种新颖的流数据多重假设检验方法,在最少假设条件下同时控制错误发现率(FDR)和错误非发现率(FNR)。该方法通过使用顺序检验统计量,将经典的Benjamini-Hochberg固定样本FDR程序扩展至顺序设置,在任意依赖结构下仍能保证误差控制,仅引入对数级膨胀因子,并支持灵活的采样设计,包括组序设计和截断设计。

ABSTRACT

We propose a general and flexible procedure for testing multiple hypotheses about sequential (or streaming) data that simultaneously controls both the false discovery rate (FDR) and false nondiscovery rate (FNR) under minimal assumptions about the data streams which may differ in distribution, dimension, and be dependent. All that is needed is a test statistic for each data stream that controls the conventional type I and II error probabilities, and no information or assumptions are required about the joint distribution of the statistics or data streams. The procedure can be used with sequential, group sequential, truncated, or other sampling schemes. The procedure is a natural extension of Benjamini and Hochberg's (1995) widely-used fixed sample size procedure to the domain of sequential data, with the added benefit of simultaneous FDR and FNR control that sequential sampling affords. We prove the procedure's error control and give some tips for implementation in commonly encountered testing situations.

研究动机与目标

  • 开发一种通用且灵活的顺序多重假设检验程序,在最少分布假设下同时控制FDR与FNR。
  • 将经典Benjamini-Hochberg程序扩展至顺序数据流,同时保持FDR控制并增加FNR控制。
  • 使该方法适用于具有依赖性、非同分布或高维数据流的场景,且无需联合分布假设。
  • 为常见统计情景中构建组件顺序检验及临界值提供实用实现指导。
  • 通过模拟研究展示该程序的性能,并与固定样本对应方法进行比较。

提出的方法

  • 提出顺序BH程序,作为Benjamini-Hochberg提升程序的顺序扩展,专为流数据设计。
  • 为每个数据流使用独立的检验统计量,控制传统的第一类与第二类错误率,且无需联合分布假设。
  • 采用顺序采样并支持拒绝(及可选的非拒绝)的早期停止,实现动态决策。
  • 应用Wald型近似与广义似然比统计量,推导顺序检验的临界值。
  • 实现一种排斥型版本,控制FDR但不一定控制FNR,适用于FNR控制非优先的场景。
  • 通过递归边界与样本空间划分,在独立性假设下证明FDR与FNR控制,并在任意依赖下以对数级膨胀因子实现控制。

实验结果

研究问题

  • RQ1能否在对数据流假设最少的条件下,使顺序多重检验程序同时控制FDR与FNR?
  • RQ2如何将Benjamini-Hochberg程序适配至顺序或流数据,同时保持FDR控制?
  • RQ3数据流之间的依赖性对顺序检验中FDR与FNR控制有何影响?
  • RQ4如何为常见统计模型推导顺序检验临界值的闭式解?
  • RQ5与固定样本对应方法相比,该顺序程序在误差控制与检验效能方面的表现如何?

主要发现

  • 顺序BH程序在任意依赖结构下仍能控制FDR,仅引入对数级膨胀因子,与Benjamini和Hochberg原始FDR证明的条件一致。
  • 在数据流相互独立的条件下,程序在水平 $\alpha \cdot (K_0 / K)$ 下控制FDR,其中 $K_0$ 为真实原假设的数量,$K$ 为假设总数。
  • 该程序同时控制错误非发现率(FNR),其证明结构对称,确保在顺序设置下两种误差率的同步控制。
  • 排斥型版本控制FDR但不一定控制FNR,当FNR控制非必需时提供一种权衡选择。
  • 模拟研究显示,该程序保持了强大的误差控制,并在顺序设置下相比固定样本对应方法展现出更高的效率。
  • 为常见检验情景推导出临界值的闭式解,使程序在计算开销极小的情况下实现实际应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。