Skip to main content
QUICK REVIEW

[论文解读] Nonuniformity of P-values Can Occur Early in Diverging Dimensions

Yingying Fan, Emre Demirkaya|arXiv (Cornell University)|May 10, 2017
Advanced Statistical Methods and Models参考文献 17被引用 14
一句话总结

本文表明,在高维设置下,广义线性模型(GLMs)中传统p值的非均匀性和无效性出现的时间远早于以往认为的时刻——具体而言,当维度 $ p $ 增长至 $ n^{2/3} $ 时即已发生,而不仅仅是在 $ p acksim n $ 时。作者通过理论分析和模拟研究证实,在非线性模型中,即使在高斯设计下,当维度发散时,最大似然估计(MLE)的渐近正态性也会因高维极限下的固有分布不一致性而崩溃。

ABSTRACT

Evaluating the joint significance of covariates is of fundamental importance in a wide range of applications. To this end, p-values are frequently employed and produced by algorithms that are powered by classical large-sample asymptotic theory. It is well known that the conventional p-values in Gaussian linear model are valid even when the dimensionality is a non-vanishing fraction of the sample size, but can break down when the design matrix becomes singular in higher dimensions or when the error distribution deviates from Gaussianity. A natural question is when the conventional p-values in generalized linear models become invalid in diverging dimensions. We establish that such a breakdown can occur early in nonlinear models. Our theoretical characterizations are confirmed by simulation studies.

研究动机与目标

  • 研究当 $ n \to \infty $ 时维度 $ p \to \infty $ 发散的广义线性模型(GLMs)中传统p值的有效性。
  • 确定在非线性模型(如逻辑回归)中,p值有效性的崩溃点是否早于线性模型中的情况,后者已知发生在 $ p \sim n $ 时。
  • 正式证明在 $ p \sim n^{\alpha_0} $ 且 $ \alpha_0 \geq 2/3 $ 时,即使在高斯设计下,广义线性模型中最大似然估计(MLE)的渐近正态性也会失效。
  • 通过随机矩阵理论和分布恒等式,解决在高维渐近框架下MLE方差估计量表现出的渐近行为矛盾。
  • 为高维渐近下GLM中p值非均匀性的现象提供理论依据,尤其是在经典渐近理论失效的非线性情形下。

提出的方法

  • 利用随机矩阵理论(RMT)研究 $ n^{-1}\mathbf{X}^T\mathbf{X} $ 的特征值行为,对高维情形 $ p \sim n^{\alpha_0} $(其中 $ \alpha_0 \in [2/3, 1) $)下GLM中MLE的渐近分布进行理论分析。
  • 在全局零假设($ \boldsymbol{\beta}_0 = \mathbf{0} $)下推导逻辑回归中MLE的极限分布,表明仅当 $ p = o(n^{1/2}) $ 时,才有 $ n^{1/2}\widehat{\beta}_j \to N(0,1) $,而超出此范围则不成立。
  • 通过变换 $ \widetilde{\boldsymbol{\beta}} = \mathbf{\Sigma}^{1/2}\boldsymbol{\beta} $,将非球形设计的一般情形简化为独立同分布高斯设计情形($ \mathbf{X} \sim N(\mathbf{0}, I_n \otimes I_p) $)。
  • 应用分布恒等式和集中不等式,证明当 $ p \sim n^{\alpha_0} $ 且 $ \alpha_0 \geq 2/3 $ 时,MLE的渐近方差估计量变得不一致,从而导致p值无效。
  • 反证法:假设在 $ p \sim n^{\alpha_0} $ 且 $ \alpha_0 \geq 2/3 $ 时渐近正态性成立,将导致MLE方差收敛速率在 $ \mathbb{R}^p $ 中的分布恒等式下不兼容。
  • 通过模拟研究验证理论发现,显示当 $ p \sim n^{2/3} $ 时p值非均匀且犯第一类错误率膨胀。

实验结果

研究问题

  • RQ1在维度发散的广义线性模型中,传统p值在何种维度阈值下会变得无效?
  • RQ2在非线性模型(如逻辑回归)中,p值有效性的崩溃是否早于线性模型中的情况(后者已知发生在 $ p \sim n $ 时)?
  • RQ3即使在高斯设计下,当 $ p \sim n^{\alpha_0} $ 且 $ \alpha_0 \geq 2/3 $ 时,GLM中MLE的渐近正态性是否仍然有效?
  • RQ4在高维GLM中,传统p值失效的原因是什么——是方差估计量的不一致,还是MLE渐近正态性的崩溃?
  • RQ5在高维渐近下,MLE方差估计量收敛速率之间的矛盾能否被形式化地解决?

主要发现

  • 在广义线性模型(GLMs)中,当 $ p \sim n^{\alpha_0} $ 且 $ \alpha_0 \geq 2/3 $ 时,即使在高斯设计和全局零假设下,传统p值也会变得非均匀且无效。
  • MLE渐近正态性的崩溃发生在 $ p \sim n^{2/3} $,早于线性模型中观察到的 $ p \sim n $ 的阈值。
  • 当 $ p \sim n^{\alpha_0} $ 且 $ \alpha_0 \geq 2/3 $ 时,MLE方差估计量的收敛速率不再趋于零,这与渐近正态性的要求相矛盾。
  • 矛盾源于不兼容的收敛速率:一个速率为 $ O_P(n^{-(1-\alpha_0)/2}) $ 趋于零,而另一个速率为 $ O_P(n^{3\alpha_0/2 - 1}) $ 发散,从而违反了 $ \mathbb{R}^p $ 中的分布恒等式。
  • 模拟研究证实,当 $ p \sim n^{2/3} $ 时,p值呈现非均匀性且具有反保守性,表明第一类错误率被放大。
  • 其根本原因在于高维极限下Fisher信息矩阵与对数似然函数Hessian矩阵之间的内在不一致性,即使设计矩阵为独立同分布高斯矩阵也是如此。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。