Skip to main content
QUICK REVIEW

[论文解读] Spiked covariances and principal components analysis in high-dimensional random effects models

Zhou Fan, Iain M. Johnstone|arXiv (Cornell University)|Jun 25, 2018
Random Matrices and Applications参考文献 55被引用 9
一句话总结

本文分析了高维随机效应和混合效应模型中具有尖峰协方差结构的主成分,识别出一种混叠现象,即主成分估计受跨分量影响而产生偏差。提出了一种谱校正方法,可渐近地消除这种混叠,从而在高维渐近条件下实现对真实主特征值和特征向量的一致估计。

ABSTRACT

We study principal components analyses in multivariate random and mixed effects linear models, assuming a spherical-plus-spikes structure for the covariance matrix of each random effect. We characterize the behavior of outlier sample eigenvalues and eigenvectors of MANOVA variance components estimators in such models under a high-dimensional asymptotic regime. Our results show that an aliasing phenomenon may occur in high dimensions, in which eigenvalues and eigenvectors of the MANOVA estimate for one variance component may be influenced by the other components. We propose an alternative procedure for estimating the true principal eigenvalues and eigenvectors that asymptotically corrects for this aliasing problem.

研究动机与目标

  • 理解在高维渐近条件下,多变量随机效应和混合效应模型中样本特征值和特征向量的行为。
  • 识别并表征MANOVA和REML估计量中的混叠现象,即一个分量的特征值和特征向量受其他分量影响而发生污染。
  • 在总体协方差具有尖峰结构时,为真实分量主成分开发一个一致的、渐近校正的估计量。
  • 在样本大小和维度按比例增长的高维渐近框架下,为校正估计量建立理论保证。

提出的方法

  • 在样本大小 $ n $ 和特征数 $ p $ 按比例增长的高维渐近框架下,分析MANOVA和REML估计量的谱性质。
  • 将随机效应的协方差结构建模为球状加尖峰形式,即一个或多个大特征值,其余构成球状主体。
  • 利用随机矩阵理论和再生核技术,推导出分量估计量的特征值和特征向量的渐近展开式。
  • 通过误差分量的特征向量对随机效应估计主成分的影响,识别出混叠效应。
  • 提出一种校正程序,可渐近消除特征值和特征向量中由跨分量污染引起的偏差。
  • 利用再生核恒等式和通过Stieltjes变换的矩匹配,推导出校正后特征值和特征向量的渐近分布。

实验结果

研究问题

  • RQ1在具有尖峰协方差结构的高维随机效应模型中,MANOVA和REML估计量的异常特征值和特征向量如何表现?
  • RQ2在高维情况下,一个分量的特征向量在多大程度上会因另一分量的谱结构而产生偏差?
  • RQ3能否构建一个渐近一致的估计量,以校正分量主成分估计中的混叠效应?
  • RQ4在高维渐近框架下,校正后特征值和特征向量的渐近分布是什么?

主要发现

  • 在高维情况下发生混叠现象,即一个分量的估计主成分受其他分量的谱结构影响而产生偏差,尤其当其特征向量部分对齐时更为显著。
  • 即使真实协方差为低秩,MANOVA或REML估计量中该分量的最大特征值仍存在向上偏倚。
  • 估计协方差矩阵的主特征向量并不与真实特征向量对齐,而是被误差分量的主导特征向量拉向其方向。
  • 所提出的校正程序可渐近消除此混叠,实现对真实主特征值和特征向量的一致估计。
  • 在高维极限下,校正估计量的特征值满足渐近正态性,特征向量实现一致对齐。
  • 该校正依赖于通过Stieltjes变换和再生核恒等式导出的谱调整,误差界通过高概率浓度不等式建立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。