Skip to main content
QUICK REVIEW

[论文解读] More Than a Toy: Random Matrix Models Predict How Real-World Neural Representations Generalize

Alexander Wei, Wei Hu|arXiv (Cornell University)|Mar 11, 2022
Neural Networks and Applications被引用 8
一句话总结

该论文表明,随机矩阵理论,特别是广义交叉验证(GCV)估计器,能够准确预测过参数化神经网络中的泛化风险——其表现优于传统的范数和谱范数基边界。论文证明了在局部随机矩阵律成立时,GCV 收敛于真实风险,并指出表征对齐(representation alignment)而非仅特征值衰减,解释了预训练模型泛化性能更优的原因。

ABSTRACT

Of theories for why large-scale machine learning models generalize despite being vastly overparameterized, which of their assumptions are needed to capture the qualitative phenomena of generalization in the real world? On one hand, we find that most theoretical analyses fall short of capturing these qualitative phenomena even for kernel regression, when applied to kernels derived from large-scale neural networks (e.g., ResNet-50) and real data (e.g., CIFAR-100). On the other hand, we find that the classical GCV estimator (Craven and Wahba, 1978) accurately predicts generalization risk even in such overparameterized settings. To bolster this empirical finding, we prove that the GCV estimator converges to the generalization risk whenever a local random matrix law holds. Finally, we apply this random matrix theory lens to explain why pretrained representations generalize better as well as what factors govern scaling laws for kernel regression. Our findings suggest that random matrix theory, rather than just being a toy model, may be central to understanding the properties of neural representations in practice.

研究动机与目标

  • 确定捕捉过参数化深度学习模型在真实世界中泛化行为所必需的理论假设。
  • 评估经典泛化边界(范数和谱范数基边界)在大规模神经网络和真实数据设置下的适用性。
  • 探究为何预训练表征的泛化性能优于随机初始化表征,尽管其特征值衰减更慢。
  • 识别控制神经表征上核岭回归缩放规律的关键因素。
  • 开发用于估计对齐性和特征值衰减的样本高效方法,以预测泛化性能。

提出的方法

  • 使用真实数据,对在 CIFAR-100 上训练的 ResNet-50 和 ResNet-34 的表征进行核岭回归,实证评估其泛化风险。
  • 将广义交叉验证(GCV)估计器与基于范数和基于谱的泛化预测器进行性能比较。
  • 证明当局部随机矩阵律(Knowles & Yin, 2017)成立时,GCV 收敛于真实泛化风险,即使在协变量异质性和高范数真实函数的情况下也成立。
  • 将近期对高维岭回归的随机矩阵分析推广至包含真实神经表征的设置。
  • 利用 GCV 估计器推导出对齐性和特征值衰减的样本高效估计器,这些估计器可预测缩放律速率。
  • 通过检验 $ f( heta, N) = y^T (XX^T + N heta I)^{-1}y $ 是否仅依赖于 $ ilde{ heta}( heta, N) = ig( extstyle extstyle rac{1}{N} extstyle extstyle rac{1}{ heta + ilde{ u}_i} ig)^{-1} $,实证验证局部 Marchenko-Pastur 定律,确认其在不同数据集规模下的一致性。

实验结果

研究问题

  • RQ1基于范数或谱的经典泛化边界能否准确预测在真实数据上训练的过参数化神经网络的泛化风险?
  • RQ2为何预训练神经表征的泛化性能优于随机初始化表征,尽管其特征值衰减更慢?
  • RQ3哪些因素控制神经表征上核岭回归中观察到的缩放规律?
  • RQ4广义交叉验证(GCV)估计器是否在不同数据集规模和正则化强度下始终一致地预测泛化风险?
  • RQ5随机矩阵律——特别是局部 Marchenko-Pastur 定律——在真实深度学习设置中在多大程度上成立?

主要发现

  • 使用 ResNet-34 的经验 NTK 在 CIFAR-100 上,GCV 估计器的测试误差为 19.9%,在风险预测精度上优于微调后的 ResNet(15.9%)。
  • 基于范数的泛化边界在真实函数具有有效无穷大核范数时变得无意义或随数据集规模增大而增加。
  • GCV 估计器在多种设置下保持高精度:包括不同数据集规模、正则化强度、模型架构(ResNet-50、ResNet-34)以及数据(CIFAR-100),涵盖随机和预训练表征。
  • 理论分析证明,只要局部随机矩阵律成立,GCV 就会收敛于真实泛化风险,即使在协变量异质性和高范数真实函数下也成立。
  • 预训练表征优于随机表征并非由于更快的特征值衰减,而是因为真实函数与总体协方差矩阵之间具有更优的对齐性。
  • 基于随机矩阵理论推导出的对齐性和特征值衰减的样本高效估计器,能准确预测自然数据上核岭回归的缩放律速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。