Skip to main content
QUICK REVIEW

[论文解读] The asymptotic spectrum of the Hessian of DNN throughout training

Arthur Paul Jacot, Franck Gabriel|arXiv (Cornell University)|Oct 1, 2019
Model Reduction and Neural Networks参考文献 35被引用 6
一句话总结

本文通过利用神经正切核(NTK)对深度神经网络(DNN)训练过程中黑塞矩阵的谱进行完整的理论表征。结果表明,黑塞矩阵渐近地分解为两个正交分量:I(与NTK相关的核主成分分析)和S(残差项),其矩生成的和可加,从而在固定NTK和平均场两种情形下,实现了对初始化和训练过程中的精确谱分析。

ABSTRACT

The dynamics of DNNs during gradient descent is described by the so-called Neural Tangent Kernel (NTK). In this article, we show that the NTK allows one to gain precise insight into the Hessian of the cost of DNNs. When the NTK is fixed during training, we obtain a full characterization of the asymptotics of the spectrum of the Hessian, at initialization and during training. In the so-called mean-field limit, where the NTK is not fixed during training, we describe the first two moments of the Hessian at initialization.

研究动机与目标

  • 对训练过程中深度神经网络黑塞矩阵谱的理论描述,这是优化动力学中一个关键但理解不足的方面。
  • 解决关于过参数化网络中平坦极小值、鞍点及泛化能力作用的开放问题。
  • 在固定NTK和平均场两种情形下,利用神经正切核(NTK)对黑塞矩阵实现完整的谱表征。
  • 建立黑塞矩阵分量I与S的渐近正交性,从而实现矩的可加性。

提出的方法

  • 将黑塞矩阵H分解为两个矩阵:I(半正定,通过NTK与核主成分分析相关)和S(残差项,在收敛时趋于零)。
  • 在固定数据点数N的条件下,分析I与S在无限宽度极限下的渐近行为。
  • 利用泛函分析与NTK参数化方法,推导S的一阶与二阶矩,表明Tr(S)在训练过程中演化,而Tr(S²)保持不变。
  • 通过Frobenius范数分析证明I与S的渐近正交性,即当网络宽度趋于无穷时,||IS||_F → 0。
  • 证明S的高阶矩在无限宽度极限下趋于零,从而简化黑塞矩阵的谱分析。
  • 将该分解方法应用于固定NTK(初始化及训练过程中)和NTK随时间演化的平均场情形。

实验结果

研究问题

  • RQ1在过参数化情形下,DNN黑塞矩阵的谱如何在训练过程中演化?
  • RQ2神经正切核(NTK)能否为黑塞矩阵谱在初始化和整个训练过程提供完整的理论描述?
  • RQ3残差矩阵S在黑塞矩阵中的作用是什么?其矩在优化过程中如何演化?
  • RQ4在无限宽度极限下,黑塞矩阵的分量I与S是否渐近正交?
  • RQ5黑塞矩阵的谱矩如何分解?能否通过I与S的矩之和来计算?

主要发现

  • 矩阵I为半正定,其特征值对应于以NTK为核的(加权)数据集核主成分分析,主成分后跟随大量小特征值。
  • I的零空间维度至少为P−N,表明在初始化及整个训练过程中存在平坦方向,源于小特征值。
  • 矩阵S在收敛时趋于零,其一阶矩Tr(S)在训练过程中演化,而Tr(S²)保持不变。
  • S的高阶矩在无限宽度极限下趋于零,从而简化了黑塞矩阵的谱分析。
  • 矩阵I与S渐近正交,因此H = I + S的k阶矩满足Tr(H^k) ≈ Tr(I^k) + Tr(S^k)。
  • 该谱分解对任意网络深度及一类有界C⁴非线性激活函数均成立,从而以NTK为依据,对黑塞矩阵谱提供了完整的描述。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。