Skip to main content
QUICK REVIEW

[论文解读] Universal Rank Inference via Residual Subsampling with Application to Large Networks

Xiao Han, Qing Yang|arXiv (Cornell University)|Dec 25, 2019
Random Matrices and Applications参考文献 23被引用 6
一句话总结

本文提出了一种通用的秩推断方法——残差子采样秩选择法(RIRS),通过在去除特征成分后对残差矩阵的条目进行子采样,检验原假设 $ K_0 $ 为大矩阵的真实秩。在原假设下,该检验统计量渐近服从标准正态分布,而在备择假设下则发散,从而在 SBM、DCSBM 和 DCMM 等多种网络模型中实现具有理论保证的一致秩估计。

ABSTRACT

Determining the precise rank is an important problem in many large-scale applications with matrix data exploiting low-rank plus noise models. In this paper, we suggest a universal approach to rank inference via residual subsampling (RIRS) for testing and estimating rank in a wide family of models, including many popularly used network models such as the degree corrected mixed membership model as a special case. Our procedure constructs a test statistic via subsampling entries of the residual matrix after extracting the spiked components. The test statistic converges in distribution to the standard normal under the null hypothesis, and diverges to infinity with asymptotic probability one under the alternative hypothesis. The effectiveness of RIRS procedure is justified theoretically, utilizing the asymptotic expansions of eigenvectors and eigenvalues for large random matrices recently developed in [11] and [12]. The advantages of the newly suggested procedure are demonstrated through several simulation and real data examples.

研究动机与目标

  • 为解决大规模矩阵数据中秩估计的关键挑战,特别是在真实秩通常未知的网络应用中。
  • 开发一种通用的、与模型无关的秩推断方法,适用于低秩加噪声模型的广泛类别,包括流行的网络模型。
  • 为 $ H_0: K = K_0 $ 与 $ H_1: K > K_0 $ 提供统计上有效的假设检验,并具备恰当的渐近分布理论。
  • 确保即使在残差矩阵条目存在相关性(源于特征成分估计误差)的情况下,方法依然有效。
  • 通过顺序检验实现对真实秩 $ K $ 的估计,即找到第一个不拒绝原假设的 $ K_0 $。

提出的方法

  • 该方法通过在去除估计的特征成分(即前 $ K_0 $ 个特征向量)后,对残差矩阵的条目进行子采样,构建检验统计量。
  • 检验统计量在原假设 $ H_0: K = K_0 $ 下设计为渐近收敛于标准正态分布,利用近期随机矩阵理论中关于特征向量和特征值的渐近展开。
  • 在备择假设 $ H_1: K > K_0 $ 下,残差矩阵仍保持特征结构,导致检验统计量以概率趋于一的方式发散至无穷大。
  • 设计了一种精细的子采样方案,以平衡估计误差与采样条目之间的依赖性,确保渐近正态性。
  • 该过程采用顺序检验框架:依次检验 $ H_0: K = K_0 $,其中 $ K_0 = 1, 2, dots, K_{ ext{max}} $,并将第一个不拒绝原假设的 $ K_0 $ 作为 $ K $ 的估计。
  • 对于非零对角线条目(如网络中的自环),还提供了确定性采样方案,以简化检验统计量。

实验结果

研究问题

  • RQ1能否为具有低秩加噪声结构的大规模矩阵数据开发一种通用的、与模型无关的秩推断方法?
  • RQ2即使残差矩阵条目存在相关性,残差子采样是否仍能使检验统计量在原假设 $ H_0: K = K_0 $ 下收敛于标准正态分布?
  • RQ3在备择假设 $ H_1: K > K_0 $ 下,检验统计量是否能发散至无穷大,从而实现一致的秩估计?
  • RQ4应如何选择子采样条目的数量,以在保持渐近正态性的同时,最小化估计误差和依赖性?
  • RQ5该方法在现实世界网络模型(如 SBM、DCSBM、MM 和 DCMM)中的适用程度如何?

主要发现

  • RIRS 检验统计量在原假设 $ H_0: K = K_0 $ 下收敛于标准正态分布,确保了有效的大小控制。
  • 在备择假设 $ H_1: K > K_0 $ 下,检验统计量以渐近概率一发散至无穷大,从而能够一致检测出秩的超额。
  • 该方法在理论上得到保障,基于大随机矩阵特征向量和特征值的渐近展开,依赖于文献 [8] 和 [9] 的结果。
  • 通过顺序检验 $ H_0: K = K_0 $ 并选择第一个不拒绝原假设的 $ K_0 $,该方法实现了稳定的秩估计。
  • 该方法适用于广泛的网络模型,包括随机块模型(SBM)、度数校正随机块模型(DCSBM)、混合成员模型(MM)和度数校正混合成员模型(DCMM)。
  • 实证和模拟研究证明了该方法在多样化场景下的有效性,包括残差条目存在相关性以及非独立同分布噪声分量的情形。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。