Skip to main content
QUICK REVIEW

[论文解读] How close is the sample covariance matrix to the actual covariance matrix?

Roman Vershynin|arXiv (Cornell University)|Apr 20, 2010
Random Matrices and Applications参考文献 22被引用 4
一句话总结

本文研究了在算子范数下近似高维随机向量的真实协方差矩阵所需的样本量 N,证明对于具有有限四阶矩的分布,N = O(n) 在对数因子范围内已足够。该文建立了样本协方差矩阵以高概率收敛到真实协方差矩阵的速率为 (n/N)^{1/2 - 2/q},优于此前对次高斯和次指数分布的研究结果。

ABSTRACT

Given a probability distribution in R^n with general (non-white) covariance, a classical estimator of the covariance matrix is the sample covariance matrix obtained from a sample of N independent points. What is the optimal sample size N = N(n) that guarantees estimation with a fixed accuracy in the operator norm? Suppose the distribution is supported in a centered Euclidean ball of radius \sqrt{n}. We conjecture that the optimal sample size is N = O(n) for all distributions with finite fourth moment, and we prove this up to an iterated logarithmic factor. This problem is motivated by the optimal theorem of Rudelson which states that N = O(n \log n) for distributions with finite second moment, and a recent result of Adamczak, Litvak, Pajor and Tomczak-Jaegermann which guarantees that N = O(n) for sub-exponential distributions.

研究动机与目标

  • 确定最小样本量 N(n, ε),以确保在算子范数下,样本协方差矩阵以高概率在误差 ε 范围内近似真实协方差矩阵。
  • 弥合已知的次指数分布结果(N=O(n))与具有有限四阶矩的一般分布之间的差距,推测 N=O(n) 为最优。
  • 将分析从次高斯和次指数分布扩展到仅具有有限四阶矩的一般分布。
  • 通过截断和矩方法技术,为样本协方差矩阵与真实协方差矩阵之差的算子范数提供更精细的集中不等式。

提出的方法

  • 使用截断论证,将估计误差分解为小系数和大系数的贡献。
  • 应用具有有限 q > 4 的矩假设(2.2),以控制尾部行为,并推导大系数的概率界。
  • 应用定理 5.1(关于秩一投影和的集中性)以控制样本协方差矩阵中大系数的贡献。
  • 应用赫尔德不等式和马尔可夫不等式,以控制超过阈值 B 的平方系数的期望。
  • 选择阈值 B = (N/n)^{2/q},以平衡误差分解中偏差与方差项之间的权衡。
  • 将三部分的界结合:主项(I₁)、大系数和(I₂)以及大系数期望贡献(I₃),以推导最终收敛速率。

实验结果

研究问题

  • RQ1对于具有有限四阶矩的一般分布,近似真实协方差矩阵在算子范数下误差固定为 ε 时,最优样本量 N(n) 是多少?
  • RQ2是否如推测的那样,对于仅具有有限四阶矩的分布,样本量 N=O(n) 可实现,还是需要更大的 N?
  • RQ3样本协方差矩阵的收敛速率如何依赖于底层分布的矩结构?
  • RQ4截断和基于矩的集中技术在多大程度上能超越次高斯或次指数假设,改进算子范数界?

主要发现

  • 对于具有有限 q > 4 矩的分布,样本协方差矩阵以高概率在算子范数下以 (n/N)^{1/2 - 2/q} 的速率近似真实协方差矩阵。
  • 所需样本量为 N = O(n),最多受 (log log n)^2 因子影响,优于一般二阶矩分布的 O(n log n) 边界。
  • 该界在分布被假设支持于半径为 O(√n) 的欧几里得球内的条件下成立,这是高维集中现象的自然条件。
  • 分析表明,算子范数误差主要由维度 n、样本量 N 和分布的矩阶 q 之间的相互作用决定。
  • 基于截断的方法成功控制了重尾系数的贡献,使得结果可从次指数分布推广至一般有限矩分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。