Skip to main content
QUICK REVIEW

[论文解读] A Generalized Benjamini-Hochberg Procedure for Multivariate Hypothesis Testing

Kasra Alishahi, Ahmad Reza Ehyaei|arXiv (Cornell University)|Jun 8, 2016
Statistical Methods in Clinical Trials参考文献 16被引用 8
一句话总结

本文提出了一种广义的Benjamini-Hochberg程序,用于多变量假设检验,通过基于多变量z值的数据自适应嵌套拒绝区域来控制错误发现率(FDR)。通过将原始BH证明扩展至允许随机、数据依赖的拒绝区域,该方法在保持FDR控制的同时,提升了高维设置下的统计功效,尤其在整合多种组学数据类型时表现更优。

ABSTRACT

The introduction of the false discovery rate (FDR) by Benjamini and Hochberg has spurred a great interest in developing methodologies to control the FDR in various settings. The majority of existing approaches, however, address the FDR control for the case where an appropriate univariate test statistic is available. Modern hypothesis testing and data integration applications, on the other hand, routinely involve multivariate test statistics. The goal, in such settings, is to combine the evidence for each hypothesis and achieve greater power, while controlling the number of false discoveries. This paper considers data-adaptive methods for constructing nested rejection regions based on multivariate test statistics (z-values). It is proved that the FDR can be controlled for appropriately constructed rejection regions, even when the regions depend on data and are hence random. This flexibility is then exploited to develop optimal multiple comparison procedures in higher dimensions, where the distribution of non-null z-values is unknown. Results are illustrated using simulated and real data.

研究动机与目标

  • 解决在高维数据整合中缺乏对多变量检验统计量的FDR控制方法的问题。
  • 开发一种灵活、数据自适应的方法,以结合多变量证据,同时保持FDR控制。
  • 将原始Benjamini-Hochberg程序推广至允许随机、数据依赖的拒绝区域。
  • 通过避免使用可能丢失信息的单变量汇总统计量,提升多变量检验中的统计功效。
  • 为未知非零分布下的多变量FDR控制提供理论基础坚实、渐近最优的程序。

提出的方法

  • 该方法基于多变量z值构建嵌套拒绝区域,其中每个区域均基于先前拒绝的假设来定义。
  • 将BH证明推广至允许数据自适应的随机拒绝区域,确保即使区域依赖于数据,也能实现FDR控制。
  • 嵌套拒绝区域(NR)算法在多维空间中通过逐轮扩展凸区域,迭代拒绝假设,自适应于数据结构。
  • 该方法假设原假设与非原假设之间相互独立,但允许多变量检验统计量之间存在依赖。
  • 该方法以保守方式将FDR控制在水平π₀q,其中π₀为原假设的比例,q为期望的FDR水平。
  • 通过广义BH程序的证明,提供了理论依据,将BH程序的适用性扩展至多变量和高维设置。

实验结果

研究问题

  • RQ1当拒绝区域为数据自适应且随机时,能否在多变量假设检验中实现FDR控制?
  • RQ2如何结合来自多种组学数据类型的多变量证据,以在控制FDR的同时提升统计功效?
  • RQ3将BH程序扩展至具有嵌套、数据驱动拒绝区域的多变量检验统计量的理论基础是什么?
  • RQ4与单变量FDR控制和Fisher方法相比,所提出的方法在功效和FDR控制方面表现如何?
  • RQ5多变量检验统计量之间的依赖性对高维设置下FDR控制有何影响?

主要发现

  • 所提出的嵌套拒绝区域(NR)算法即使在拒绝区域为数据自适应且随机的情况下,也能将FDR控制在水平π₀q。
  • 在模拟数据和TCGA真实数据中,NR方法的统计功效高于Fisher方法和单变量FDR控制,拒绝了更多假设,同时保持了FDR控制。
  • SC方法需要估计π₀,拒绝的假设最多,但缺乏保证的FDR控制,凸显了功效与错误率控制之间的权衡。
  • Fisher方法虽然在相关系数为1时预期能控制FDR,但表现出更高的假阴性率,拒绝的假设更少,表明可能存在功效损失。
  • 使用NR方法整合基因表达和DNA甲基化数据,相比单独分析任一数据类型,显著提升了统计功效,证明了多变量整合的优势。
  • NR方法生成的拒绝区域在变换空间中近似呈圆形,反映了数据的相关性结构,并在迭代过程中自适应演化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。