[论文解读] Type I error rate control for testing many hypotheses: a survey with proofs
本文对多重假设检验中控制第一类错误率的统一综述及新理论结果进行了研究,重点聚焦于k家族错误率(kFWER)和错误发现比例(FDP)。提出了一种新颖的分位数-二项分布程序,在独立性条件下控制FDP,提供了简洁的证明以及在各种依赖假设下的逐步上升/下降程序的一般框架。
This paper presents a survey on some recent advances for the type I error rate control in multiple testing methodology. We consider the problem of controlling the $k$-family-wise error rate (kFWER, probability to make $k$ false discoveries or more) and the false discovery proportion (FDP, proportion of false discoveries among the discoveries). The FDP is controlled either via its expectation, which is the so-called false discovery rate (FDR), or via its upper-tail distribution function. We aim at deriving general and unified results together with concise and simple mathematical proofs. Furthermore, while this paper is mainly meant to be a survey paper, some new contributions for controlling the kFWER and the upper-tail distribution function of the FDP are provided. In particular, we derive a new procedure based on the quantiles of the binomial distribution that controls the FDP under independence.
研究动机与目标
- 提供对近期控制多重检验中第一类错误率进展的全面且统一的综述,特别是针对kFWER和FDP。
- 为关键的多重检验程序推导出通用且简洁的数学证明,以增强理论清晰度和可及性。
- 解决在高维检验设置下,对正相关性和任意依赖结构中控制错误率的挑战。
- 提出一种基于二项分布分位数的新程序,可在独立性条件下控制错误发现比例(FDP),填补现有方法的空白。
- 阐明FDR控制与FDP控制之间的区别,强调在实际应用中FDP尾部分布控制的重要性。
提出的方法
- 基于p值的一般性多重检验程序框架,强调用于错误率控制的逐步上升和逐步下降算法。
- 应用狄拉克配置的概念,分析原假设下检验统计量的行为,并推导错误率属性。
- 采用源自二项分布的分位数阈值,构建一种新程序,以在独立性条件下控制FDP的上尾分布。
- 推导线性逐步上升和自适应线性逐步上升程序在各种依赖假设下控制错误发现率(FDR)和kFWER的条件。
- 利用逆分布函数和生存函数等数学工具,刻画检验程序的显著性水平和功效。
- 为关键结果提供严谨证明,包括某些程序与已知方法(如LR2005的定理3.1和RW2007的定理4.1(i))等价性的推论。
实验结果
研究问题
- RQ1如何通过一种新颖的、基于分布的程序,在独立性条件下控制错误发现比例(FDP)?
- RQ2在正相关或任意依赖结构下,逐步下降和逐步上升程序在何种理论条件下能控制kFWER和FDR?
- RQ3所提出的分位数-二项分布程序与现有FDP控制方法相比,在错误率控制和功效方面有何差异?
- RQ4在连续与离散原假设分布下,p值和检验统计量的显著性水平属性有何不同?
- RQ5FDR控制与FDP上尾分布控制之间的关系是什么?为何在某些场景下后者更为合适?
主要发现
- 所提出的分位数-二项分布程序通过使用二项分布分位数导出的临界值,在独立性条件下控制了错误发现比例(FDP)。
- 本文确立了:在连续原假设分布下,基于标准p值的检验为显著性水平α;而在离散分布下,p值检验可能超过α,因此需要采用修正方法。
- 在正相关性下,kFWER控制的逐步下降方法被证明是有效的,其复杂度随检验数量线性增长。
- 理论结果表明,即使FDR未被控制,也可通过逐步下降程序控制FDP的上尾分布,凸显了FDR与FDP控制之间的关键区别。
- 本文证明了线性逐步上升程序在测试统计量为正相关时,可在任意依赖结构下控制FDR,扩展了早期结果。
- 理论分析确认,自适应线性逐步上升程序在正相关下仍能保持FDR控制,为高维数据分析提供了一种实用且高效的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。