Skip to main content
QUICK REVIEW

[论文解读] Traces of Class/Cross-Class Structure Pervade Deep Learning Spectra

Vardan Papyan|arXiv (Cornell University)|Aug 27, 2020
Sparse and Compressive Sensing Techniques参考文献 74被引用 8
一句话总结

本文在深度学习谱中识别出一种基本的类/跨类结构,证明了谱异常值、'尖峰'和'凸起'源于费舍尔信息矩阵与海森矩阵中的类别特异性信息。该研究证明了异常值与主干部分的比值可预测多项式逻辑回归中的误分类,展示了网络如何随深度对齐类别特异性特征,并提出一种针对KFAC的秩-1校正以改善优化。

ABSTRACT

Numerous researchers recently applied empirical spectral analysis to the study of modern deep learning classifiers. We identify and discuss an important formal class/cross-class structure and show how it lies at the origin of the many visually striking features observed in deepnet spectra, some of which were reported in recent articles, others are unveiled here for the first time. These include spectral outliers, "spikes", and small but distinct continuous distributions, "bumps", often seen beyond the edge of a "main bulk". The significance of the cross-class structure is illustrated in three ways: (i) we prove the ratio of outliers to bulk in the spectrum of the Fisher information matrix is predictive of misclassification, in the context of multinomial logistic regression; (ii) we demonstrate how, gradually with depth, a network is able to separate class-distinctive information from class variability, all while orthogonalizing the class-distinctive information; and (iii) we propose a correction to KFAC, a well-known second-order optimization algorithm for training deepnets.

研究动机与目标

  • 识别并形式化深度神经网络海森矩阵与费舍尔信息矩阵谱特征背后的类/跨类结构。
  • 解释在深度学习谱中观察到的视觉上引人注目的谱模式——异常值、尖峰和凸起的成因。
  • 证明谱异常值与主干部分的比值可预测多项式逻辑回归中的模型误分类。
  • 展示深度网络如何随深度逐步将类别特异性信息与类别可变性分离,同时实现正交化。
  • 基于所识别的结构,提出一种针对KFAC优化算法的秩-1校正。

提出的方法

  • 使用费舍尔信息矩阵(FIM)和海森矩阵的谱分析,识别类别特异性特征的特征值结构。
  • 应用子空间迭代方法提取前C个特征值和特征向量,对应于类别均值,以实现精确的谱分辨率。
  • 采用带归一化与去归一化的Lanczos近似方法,高效估计大型算子的谱。
  • 使用幂律拟合分析特征值分布尾部行为,超出主干部分,拒绝经典随机矩阵理论(RMT)模型。
  • 通过整合FIM的前C个特征向量,提出对KFAC的秩-1校正,提升优化稳定性。
  • 在VGG11、ResNet18和MLP模型上,针对MNIST、FashionMNIST、CIFAR10和CIFAR100数据集,采用受控训练协议进行大量实验。

实验结果

研究问题

  • RQ1深度学习谱中的谱异常值、尖峰和凸起的成因是什么?
  • RQ2费舍尔信息矩阵中的类/跨类结构如何影响海森矩阵的谱?
  • RQ3谱异常值与主干部分的比值是否可预测多项式逻辑回归中的误分类?
  • RQ4网络内部表征随深度演化时,如何实现类别特异性信息与类别可变性信息的分离?
  • RQ5所识别的谱结构能否用于改进类似KFAC的二阶优化算法?

主要发现

  • 海森矩阵与费舍尔信息矩阵中的谱异常值数量始终等于类别数C,且这些异常值对应于类别均值的梯度。
  • FIM谱中异常值与主干部分的比值可预测多项式逻辑回归中的误分类,比值越高,误分类风险越大。
  • 子空间迭代可精确检测异常特征值,并提升主干分布的分辨率,揭示此前被掩盖的谱特征。
  • 海森矩阵谱在主干之外的尾部呈现幂律衰减,拟合决定系数R² > 0.99,表明其无法用经典随机矩阵理论解释。
  • 所提出的基于FIM前C个特征向量的KFAC秩-1校正,通过更好地匹配类别特异性信息的内在几何结构,提升了优化性能。
  • 类/跨类结构在不同架构与数据集中持续存在,包括ResNet18等先进模型,即使在大规模设置下亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。