Skip to main content
QUICK REVIEW

[论文解读] Asymptotically Independent U-Statistics in High-Dimensional Testing

Yinqiu He, Gongjun Xu|arXiv (Cornell University)|Sep 2, 2018
Random Matrices and Applications参考文献 66被引用 4
一句话总结

该论文提出了一类渐近独立的U-统计量,用于高维全局检验,实现了对不同阶数p值的自适应组合,从而在稀疏、密集和中间型备择假设下均保持稳健的检验效能。关键贡献在于在原假设下建立了不同阶数U-统计量的渐近独立性与正态性,使得可通过费希尔方法进行有效的p值组合,并在各类备择假设下均展现出更优的检验效能。

ABSTRACT

Many high-dimensional hypothesis tests aim to globally examine marginal or low-dimensional features of a high-dimensional joint distribution, such as testing of mean vectors, covariance matrices and regression coefficients. This paper constructs a family of U-statistics as unbiased estimators of the $\ell_p$-norms of those features. We show that under the null hypothesis, the U-statistics of different finite orders are asymptotically independent and normally distributed. Moreover, they are also asymptotically independent with the maximum-type test statistic, whose limiting distribution is an extreme value distribution. Based on the asymptotic independence property, we propose an adaptive testing procedure which combines $p$-values computed from the U-statistics of different orders. We further establish power analysis results and show that the proposed adaptive procedure maintains high power against various alternatives.

研究动机与目标

  • 解决在真实备择结构(稀疏、密集或中间型)未知时,高维全局检验中统计效能偏低的挑战。
  • 构建高维参数(如均值向量、协方差矩阵、回归系数)ℓp-范数无偏估计量的统一框架。
  • 在原假设下建立不同阶数U-统计量的渐近独立性与正态性,以支持有效的p值组合。
  • 提出一种自适应检验程序,通过组合多个U-统计量的p值,实现在多种备择类型下均保持高检验效能。
  • 提供理论检验效能分析与数值验证,表明在广泛备择假设下均具有稳健的表现。

提出的方法

  • 将阶数为a的U-统计量构造为∥E∥a_a = ∑_{l∈L} e^a_l的无偏估计量,使用i.i.d.观测值的核函数。
  • 将阶数为a的U-统计量定义为U(a) = (P^n_a)^{-1} ∑_{l∈L} ∑_{1≤i1≠⋯≠ia≤n} ∏_{k=1}^a K_l(z_{i_{(k-1)γ_l+1}}, ..., z_{i_{kγ_l}}),其中K_l是参数e_l的无偏核函数。
  • 利用在原假设下不同阶数U-统计量的渐近独立性,该性质通过联合渐近正态性得以证明。
  • 通过费希尔方法组合多个阶数U-统计量的p值,形成具有稳健检验效能的自适应检验。
  • 使用置换法或渐近近似方法估计原假设下最大型统计量(U(∞))的极限分布。
  • 将该自适应程序应用于实际问题,如两样本均值与协方差检验,以及全基因组关联研究(GWAS)应用。

实验结果

研究问题

  • RQ1在高维原假设下,不同阶数的U-统计量是否渐近独立?
  • RQ2将多个阶数U-统计量的p值进行组合,是否能获得在各类备择类型(稀疏、密集、中间型)下均具有高检验效能的检验程序?
  • RQ3在微弱、稀疏和中等程度备择假设下,所提出的U-统计量与现有平方和检验及最大型检验相比表现如何?
  • RQ4不同阶数U-统计量渐近独立性的理论依据及其极限分布是什么?
  • RQ5当真实备择结构未知或在不同场景中变化时,该自适应程序是否能保持高检验效能?

主要发现

  • 在原假设下,不同有限阶数的U-统计量渐近独立且联合服从正态分布,支持有效的p值组合。
  • 阶数a=2的U-统计量为平方和型估计量,而更高阶数(如a→∞)则近似于最大型统计量,可捕捉不同的备择结构。
  • 在极端微弱情形(模型1)下,U(1)和U(2)在p=300时的经验检验效能分别为0.416和0.484,而自适应程序(adpUf2)达到0.781。
  • 在极端稀疏情形(模型2)下,高阶U-统计量(U(4),U(∞))的检验效能接近1,而U(1)和U(2)在p=300时分别降至0.049和0.122。
  • 在中等稀疏与微弱情形(模型3)下,有限阶数U(5)最为有效(在p=300时效能为0.946),而自适应程序(adpUf2)保持高检验效能(在p=300时为0.940),而其他方法如Chen、Sriva和Schott则失效。
  • 所提出的自适应程序(adpUf2)在计算成本较高的方法(Pan1,Pan2)表现相当或更优的同时,显著提升了计算效率,尤其在p较大时优势明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。