[论文解读] Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability
本文表明,神经网络上的全批量梯度下降始终在‘稳定性边缘’运行,此时最大Hessian特征值(尖锐度)稳定在2/η之上,导致训练损失非单调但最终下降。这种行为与标准优化假设相悖,挑战了深度学习训练中关于收敛性和平滑性的主流理论。
We empirically demonstrate that full-batch gradient descent on neural network training objectives typically operates in a regime we call the Edge of Stability. In this regime, the maximum eigenvalue of the training loss Hessian hovers just above the numerical value $2 / ext{(step size)}$, and the training loss behaves non-monotonically over short timescales, yet consistently decreases over long timescales. Since this behavior is inconsistent with several widespread presumptions in the field of optimization, our findings raise questions as to whether these presumptions are relevant to neural network training. We hope that our findings will inspire future efforts aimed at rigorously understanding optimization at the Edge of Stability. Code is available at https://github.com/locuslab/edge-of-stability.
研究动机与目标
- 研究全批量梯度下降在神经网络训练目标上的动态行为。
- 挑战优化理论中关于神经网络训练中单调下降和L-平滑性的主流假设。
- 通过实证方法表征训练过程中Hessian最大特征值(尖锐度)的行为。
- 识别出一个一致的范式——‘稳定性边缘’——在此范式中,尖锐度始终略高于2/η,且尽管存在非单调性,训练损失仍随时间减少。
- 激发能够解释稳定性边缘处优化动态的新理论框架。
提出的方法
- 在CIFAR-10等标准数据集上,对多种神经网络架构应用全批量梯度下降。
- 在整个训练过程中计算并追踪不同步长η下训练损失Hessian的最大特征值(尖锐度)。
- 以二次函数上的梯度下降理论稳定性分析作为基线,定义临界阈值2/η。
- 通过实证分析比较不同损失函数(交叉熵和MSE)及不同步长下尖锐度的演化。
- 在多种架构和数据集上分析该行为,以评估其泛化能力。
- 将全批量GD与随机梯度下降(SGD)进行对比,指出两者在尖锐度动态上的差异,以及SGD中缺乏尖锐度趋于平稳的现象。
实验结果
研究问题
- RQ1全批量梯度下降在神经网络上是否在不同架构和任务中表现出一致的动力学范式?
- RQ2在训练过程中,步长η与最大Hessian特征值(尖锐度)之间存在何种关系?
- RQ3为何在稳定性边缘范式中,训练损失呈现非单调性却仍能收敛?
- RQ4稳定性边缘范式如何与优化理论中的关键假设(如L-平滑性和平稳下降)相矛盾?
- RQ5现有SGD模型(如Jastrzębski等人,2020年提出的模型)在多大程度上可推广至全批量梯度下降?
主要发现
- 全批量梯度下降在各种架构和任务中始终运行于稳定性边缘,最大Hessian特征值稳定在2/η之上。
- 当尖锐度低于2/η时,其会持续变尖,逐渐趋近于该阈值。
- 一旦尖锐度超过2/η,梯度下降不会发散,而是稳定在该值附近,进入稳定性边缘范式。
- 尽管在短时间尺度上呈现非单调行为,但长期来看训练损失持续下降,表明优化有效。
- 在CIFAR-10上的标准架构中,合理的步长始终导致稳定性边缘范式,使其成为常态而非例外。
- 稳定性边缘范式与优化理论中的关键假设相矛盾,包括单调下降、L-平滑性以及二次泰勒近似。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。