Skip to main content
QUICK REVIEW

[论文解读] A comprehensive error rate for multiple testing

Djalel Eddine Meskaldji, Dimitri Van De Ville|arXiv (Cornell University)|Dec 19, 2011
Statistical Methods in Clinical Trials参考文献 17被引用 9
一句话总结

本文通过分析应用于有序p值的任意非递减阈值序列,提出了一套全面的错误率框架,用于多重假设检验。研究证明,在一般依赖结构下,通过重构函数控制期望错误发现比例是可行的,该方法推广了经典的Benjamini-Hochberg程序,并在各种依赖假设下实现了更紧密的控制。

ABSTRACT

The higher criticism of a family of tests starts with the individual uncorrected p-values of each test. It then requires a procedure for deciding whether the collection of p-values indicates the presence of a real effect and if possible selects the ones that deserve closer scrutiny. This paper investigates procedures in which the ordered p-values are compared to an arbitrary positive and non-decreasing threshold sequence.

研究动机与目标

  • 解决经典多重检验程序在同时检验大量假设时控制错误率的局限性。
  • 开发一种灵活的框架,将现有错误率控制方法(如FDR、FWER)推广至非独立假设之外。
  • 通过阈值序列与重构函数,将各种逐步提升和逐步降低的程序统一于单一理论结构之下。
  • 在一般依赖结构(包括正相关依赖和任意依赖)下,实现保守的错误率控制。
  • 通过标准阈值序列的变换,实现新错误度量的推导及其控制。

提出的方法

  • 提出一般阈值序列 $ t_r = \xi(s_r)\alpha/m $,其中 $ s_r $ 为非递减形状序列,$ \xi $ 为重构函数。
  • 将惩罚错误超额率(pFER)定义为 $ \mathbb{P}(\text{FP}/s_R > q) $,该定义推广了FDR,并允许基于中位数的错误控制。
  • 应用马尔可夫不等式,在独立性和正相关依赖下推导出pFER的保守控制。
  • 使用逆重构函数 $ \xi^{-1}(r) $,将期望错误发现比例表达为 $ \mathbb{E}[\text{FP}/\xi^{-1}(R)] \leq \alpha $。
  • 证明Benjamini-Hochberg程序控制 $ \mathbb{E}[\text{FP}/(R \sum_{i=1}^m 1/i)] \leq \alpha $,在一般依赖结构下可推出 $ \mathbb{E}[\text{FDP}] \leq \alpha \log m $。
  • 通过证明误差率在大样本条件下收敛于FDR,建立了最优拒绝曲线(ORC)的渐近控制。

实验结果

研究问题

  • RQ1如何通过任意阈值序列,将现有多重检验程序统一于单一理论框架之下?
  • RQ2在p值的不同依赖假设下,给定阈值序列控制了哪些错误率?
  • RQ3能否通过重构函数方法,在一般依赖结构下保守控制错误发现比例?
  • RQ4阈值序列的形状与最终错误率控制之间存在何种关系?
  • RQ5所提出的框架如何在不同假设下推广经典程序(如Benjamini-Hochberg和Hochberg)?

主要发现

  • Benjamini-Hochberg程序在任意依赖结构下控制 $ \mathbb{E}[\text{FP}/(R \sum_{i=1}^m 1/i)] \leq \alpha $,这意味着 $ \mathbb{E}[\text{FDP}] \leq \alpha \log m $。
  • 当 $ q = 0.5 $ 时,惩罚错误超额率(pFER)对应于FDP的中位数,使用 $ \alpha/2 $ 的BH程序可确保中位数在水平 $ \alpha $ 下受控。
  • Hochberg的逐步提升程序在独立性和正相关依赖下控制 $ \mathbb{E}[\text{FP} \cdot (m-R+1)/m] \approx \mathbb{E}[\text{FP}] $。
  • 最优拒绝曲线(ORC)阈值序列 $ t_r = r\alpha / (m - r(1 - \alpha)) $ 在 $ m \to \infty $ 时渐近控制FDR,且在独立性和正相关依赖下展示了误差率的收敛性。
  • 在一般依赖结构下,当使用 $ t_r = \xi(s_r)\alpha/m $ 时,若 $ \xi $ 为重构函数,则误差率 $ \mathbb{E}[\text{FP}/\xi(q s_R)] \leq \alpha $ 可被控制。
  • 该框架揭示,阈值序列与重构函数的选择直接决定了所控制的错误率,从而可系统性地推导出新的错误度量及其控制方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。