Skip to main content
QUICK REVIEW

[论文解读] Estimation of False Discovery Proportion with Unknown Dependence

Jianqing Fan, Xu Han|arXiv (Cornell University)|May 30, 2013
Statistical Methods in Clinical Trials参考文献 35被引用 7
一句话总结

本文提出了一套理论基础坚实的框架,用于在检验统计量存在依赖性且协方差矩阵未知的情况下,估计大规模多重检验中的错误发现比例(FDP)。通过利用稀疏或因子结构依赖下的特征值/特征向量估计方法——特别是POET估计器——该研究证明,即使在依赖结构未知的情况下,FDP仍可被一致地近似,从而扩展了以往假设协方差矩阵已知的研究工作。

ABSTRACT

Large-scale multiple testing with highly correlated test statistics arises frequently in many scientific research. Incorporating correlation information in estimating false discovery proportion has attracted increasing attention in recent years. When the covariance matrix of test statistics is known, Fan, Han & Gu (2012) provided a consistent estimate of False Discovery Proportion (FDP) under arbitrary dependence structure. However, the covariance matrix is often unknown in many applications and such dependence information has to be estimated before estimating FDP (Efron, 2010). The estimation accuracy can greatly affect the convergence result of FDP or even violate its consistency. In the current paper, we provide methodological modification and theoretical investigations for estimation of FDP with unknown covariance. First we develop requirements for estimates of eigenvalues and eigenvectors such that we can obtain a consistent estimate of FDP. Secondly we give conditions on the dependence structures such that the estimate of FDP is consistent. Such dependence structures include sparse covariance matrices, which have been popularly considered in the contemporary random matrix theory. When data are sampled from an approximate factor model, which encompasses most practical situations, we provide a consistent estimate of FDP via exploiting this specific dependence structure. The results are further demonstrated by simulation studies and some real data applications.

研究动机与目标

  • 解决在高维多重检验中,当检验统计量的协方差矩阵未知时,估计错误发现比例(FDP)的挑战,这是该领域常见问题。
  • 正式分析在未知依赖下,估计特征值与特征向量对FDP近似精度的影响。
  • 构建一个通用框架,确保在稀疏、带状或近似因子模型协方差结构下,FDP估计的一致性。
  • 将结果推广至多元正态分布以外的一般依赖假设。
  • 为在未知依赖下使用POET估计器进行FDP估计提供理论依据,并通过模拟和真实数据验证其有限样本性能。

提出的方法

  • 提出一种通用的FDP估计框架,通过估计协方差矩阵的特征结构(特征值与特征向量)来处理未知依赖。
  • 采用POET(主正交补阈值)方法对估计的协方差矩阵进行谱分解,以建模高维依赖结构。
  • 建立理论条件,证明在稀疏性或因子模型假设下,估计的特征值与特征向量可实现FDP的一致近似。
  • 推导FDP估计器的非渐近误差界,表明估计误差的阶为 $ O_p(p^ heta (k( ho_n + m_p ho_n^{1-q} p^{-1}) + mu^* p^{-1/2})) $,其中 $ \rho_n $ 控制特征值与特征向量的估计误差。
  • 利用Weyl定理和 $ \sin \theta $ 定理,对由估计误差引起的特征值与特征向量扰动进行上界控制。
  • 在多元正态与非正态误差分布下验证该方法,表明其对分布误设具有鲁棒性。

实验结果

研究问题

  • RQ1未知依赖性——特别是需要估计协方差矩阵——如何影响错误发现比例(FDP)估计的准确性?
  • RQ2协方差矩阵结构(如稀疏、带状、因子模型)需满足何种条件,才能在协方差未知时实现FDP估计的一致性?
  • RQ3POET估计器能否在未知依赖下为FDP估计提供理论依据?其对应的FDP估计器收敛速度如何?
  • RQ4在高维多重检验中,边际方差与特征结构估计误差的联合影响如何作用于FDP近似?
  • RQ5该框架在多大程度上可推广至检验统计量非多元正态分布的情形?

主要发现

  • 本文证明,当通过POET估计协方差矩阵的特征结构时,即使真实协方差未知,FDP仍可实现一致估计。
  • FDP估计器的估计误差被控制在 $ O_p(p^ heta (k( ho_n + m_p ho_n^{1-q} p^{-1}) + mu^* p^{-1/2})) $ 以内,其中 $ \rho_n $ 反映了特征值与特征向量的估计误差。
  • 在近似因子模型下,该方法可实现FDP的一致近似,且通过POET过程控制了特征值与特征向量的估计误差。
  • 理论结果表明,即使放宽多元正态性假设,FDP估计器仍保持一致性,显示出良好的鲁棒性。
  • 模拟研究与真实数据应用均证实,该方法在现实依赖结构下有效控制FDP,具有实际有效性。
  • 该框架为在FDP估计中使用基于特征结构的方法提供了正式理论依据,解决了以往方法因假设已知或错误依赖结构而存在的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。