Skip to main content
QUICK REVIEW

[论文解读] Tests for High-Dimensional Covariance Matrices Using Random Matrix Projection

Tung-Lung Wu, Ping Li|arXiv (Cornell University)|Nov 5, 2015
Random Matrices and Applications被引用 6
一句话总结

本文提出一种基于随机投影的方法,通过将高维数据降维至一维,实现对高维协方差矩阵的检验,从而可使用标准似然比检验。该方法在一般条件下保持渐近正态性,且在协方差差异接近正定或负定时优于现有方法,但在差异接近奇异时失效。

ABSTRACT

The classic likelihood ratio test for testing the equality of two covariance matrices breakdowns due to the singularity of the sample covariance matrices when the data dimension $p$ is larger than the sample size $n$. In this paper, we present a conceptually simple method using random projection to project the data onto the one-dimensional random subspace so that the conventional methods can be applied. Both one-sample and two-sample tests for high-dimensional covariance matrices are studied. Asymptotic results are established and numerical results are given to compare our method with state-of-the-art methods in the literature.

研究动机与目标

  • 解决当 p > n 时经典似然比检验在高维协方差矩阵检验中因样本协方差矩阵奇异而失效的问题。
  • 为高维设置下一组样本和两组样本检验开发一种计算高效且概念简单的检验方法。
  • 通过使用随机投影将维度降低至一维,克服现有方法对 p 与 n 之间特定关系的限制。
  • 在不限制 p/n 比值的条件下,建立检验统计量在一般条件下的渐近正态性。
  • 通过大量模拟实验,评估该方法相对于最先进方法(CLRT 和 Li & Chen)的性能。

提出的方法

  • 使用 i.i.d. 标准正态分布条目的随机投影向量 R,将高维数据投影到一维子空间。
  • 对降维后的数据应用标准的一组样本和两组样本似然比检验,此时数据为标量,避免了奇异问题。
  • 对一组样本检验使用检验统计量 T₁ = n·(tr(S) − log|S| − p),对两组样本检验使用 T₂。
  • 在原假设下,当 n 和 p 同时趋于无穷大时,推导检验统计量的渐近正态性,且无需要求 p/n → c。
  • 采用归一化随机投影向量,以实现更快收敛和更优的实证性能。
  • 在较弱条件下分析不同随机投影之间协方差的收敛速度。

实验结果

研究问题

  • RQ1当经典方法失效时,将高维数据随机投影至一维是否能保留足够信号,以实现有效的高维协方差检验?
  • RQ2在不同 p 和 n 配置下,该随机投影方法在大小和功效方面与 CLRT 及 Li & Chen 方法相比表现如何?
  • RQ3在协方差矩阵差异的何种条件下(如正定、奇异等),该随机投影方法会成功或失败?
  • RQ4当使用一维随机投影时,检验统计量在原假设下的渐近分布为何?
  • RQ5该方法是否在不依赖 p 与 n 之间特定关系的情况下保持良好的实证性能?

主要发现

  • 该随机投影方法在一般条件下实现检验统计量的渐近正态性,即使当 p/n → ∞ 时也无需对 p/n 设定固定极限。
  • 在模拟实验中,当协方差矩阵差异接近正定或负定时,该方法优于 CLRT 和 Li & Chen 方法,在 p=4096, n=100 时达到 0.9997 的实证功效。
  • 当协方差矩阵差异接近奇异(如对角线相同)时,该方法失效,因为投影后方差差异的期望值为零,无论非对角线信号如何。
  • 在情况 (i)(强正定差异)下,该方法在 p=4096, n=100 时实现 100% 的实证功效,而 CLRT 和 Li & Chen 方法的功效较低。
  • 归一化随机投影向量相比非归一化版本能更快收敛至渐近正态性,从而提升实证大小的准确性。
  • 该方法计算高效、易于实现且可解释,适用于大规模高维数据分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。