Skip to main content
QUICK REVIEW

[论文解读] Control of the False Discovery Rate Under Arbitrary Covariance Dependence

Xu Han, Weijie Gu|arXiv (Cornell University)|Dec 20, 2010
Statistical Methods in Clinical Trials参考文献 25被引用 15
一句话总结

本文提出一种主因子近似(PFA)方法,通过协方差矩阵的谱分解去除强共同因子,以在高维多重假设检验中控制任意依赖结构下的错误发现率(FDR)。该方法实现了错误发现比例(FDP)的一致估计,并在相关检验统计量下优于Efron的方法。

ABSTRACT

Multiple hypothesis testing is a fundamental problem in high dimensional inference, with wide applications in many scientific fields. In genome-wide association studies, tens of thousands of tests are performed simultaneously to find if any genes are associated with some traits and those tests are correlated. When test statistics are correlated, false discovery control becomes very challenging under arbitrary dependence. In the current paper, we propose a new methodology based on principal factor approximation, which successfully substracts the common dependence and weakens significantly the correlation structure, to deal with an arbitrary dependence structure. We derive the theoretical distribution for false discovery proportion (FDP) in large scale multiple testing when a common threshold is used and provide a consistent FDP. This result has important applications in controlling FDR and FDP. Our estimate of FDP compares favorably with Efron (2007)'s approach, as demonstrated by in the simulated examples. Our approach is further illustrated by some real data applications.

研究动机与目标

  • 解决在检验统计量存在任意依赖结构时控制FDR的挑战,这是高维推断中的常见问题。
  • 开发一种方法,充分整合协方差信息,而非假设独立性或特定依赖结构。
  • 在一般依赖条件下推导错误发现比例(FDP)的一致估计量,从而实现可靠的FDR控制。
  • 改进现有FDR程序(如Benjamini-Hochberg和Storey的方法),这些方法在高相关性下会损失准确性。
  • 提供一个理论基础坚实、可扩展的解决方案,适用于全基因组关联研究(GWAS)等现实世界问题。

提出的方法

  • 利用已知协方差矩阵 $\Sigma$ 的谱分解,提取导致检验统计量强依赖性的主因子。
  • 应用主因子近似(PFA)以去除主导的共同因子,从而弱化整体依赖结构。
  • 在 $p$ 较大时推导错误发现比例(FDP)的渐近分布,考虑因子去除后残留的弱依赖性。
  • 采用基于阈值的程序,其中 $\widehat{\text{FDR}}(t) = \widehat{p}_0 t / (R(t) \vee 1)$,求解满足 $\widehat{\text{FDR}}(t) \leq \alpha$ 的 $t$,其中 $\widehat{p}_0$ 从数据中估计。
  • 使用标准正态累积分布函数 $\Phi$ 和标准正态密度 $\phi$ 建模FDP估计中的尾部概率,结合估计的因子载荷和权重。
  • 应用柯西-施瓦茨不等式和集中不等式,在特征值和因子载荷满足正则性条件时,建立FDP估计量的渐近一致性。

实验结果

研究问题

  • RQ1当检验统计量表现出任意依赖结构(包括高度相关性)时,能否一致地控制FDR?
  • RQ2如何有效去除高维数据中的共同依赖结构,以改善FDR估计?
  • RQ3在一般依赖条件下,错误发现比例(FDP)的理论分布是什么?能否实现其一致估计?
  • RQ4在检验统计量相关时,所提出的PFA方法与Efron(2007)的经验贝叶斯方法相比性能如何?
  • RQ5该方法在全基因组关联研究等现实应用中,能在多大程度上保持检验效能和准确性?

主要发现

  • 所提出的PFA方法在任意依赖结构下实现了错误发现比例(FDP)的一致估计,即使协方差矩阵非平凡亦成立。
  • 理论分析表明,在特征值和因子载荷有界等正则性条件下,FDP估计量以概率收敛于真实FDP。
  • 在模拟示例中,该方法优于Efron(2007)的方法,尤其在高相关性设置下,FDR控制最易受损。
  • 在适当的矩条件成立下,FDP估计量的收敛速度为 $O_p(\sqrt{k/m})$,其中 $k$ 为因子数量,$m$ 为样本量。
  • 该程序即使在检验统计量高度相关时,也能在模拟和真实数据应用中将FDR控制在名义水平 $\alpha$ 以内。
  • 该方法具有可扩展性,适用于大规模问题(如GWAS),在成千上万个假设同时检验且依赖结构复杂的情境下具有适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。