Skip to main content
QUICK REVIEW

[论文解读] Special Properties of Gradient Descent with Large Learning Rates

Amirkeivan Mohtashami, Martin Jaggi|arXiv (Cornell University)|May 30, 2022
Stochastic Gradient Optimization Techniques被引用 6
一句话总结

本文表明,梯度下降(GD)中的大学习率即使在缺乏随机噪声的情况下,也能实现从非凸优化中的局部极小值逃逸,这挑战了当前认为随机性是SGD成功唯一解释的主流理论。作者通过理论证明和实验验证,发现大学习率会引发与小学习率不同的轨迹,这些轨迹最终收敛至全局极小值,而小学习率则会困于局部极小值,从而确立了学习率大小在噪声放大之外的根本作用。

ABSTRACT

When training neural networks, it has been widely observed that a large step size is essential in stochastic gradient descent (SGD) for obtaining superior models. However, the effect of large step sizes on the success of SGD is not well understood theoretically. Several previous works have attributed this success to the stochastic noise present in SGD. However, we show through a novel set of experiments that the stochastic noise is not sufficient to explain good non-convex training, and that instead the effect of a large learning rate itself is essential for obtaining best performance.We demonstrate the same effects also in the noise-less case, i.e. for full-batch GD. We formally prove that GD with large step size -- on certain non-convex function classes -- follows a different trajectory than GD with a small step size, which can lead to convergence to a global minimum instead of a local one. Our settings provide a framework for future analysis which allows comparing algorithms based on behaviors that can not be observed in the traditional settings.

研究动机与目标

  • 探究GD中的大学习率是否在放大随机噪声之外提供优化优势。
  • 正式证明在非凸设置下,大学习率与小学习率会产生不同的轨迹。
  • 表明大学习率可导致收敛至全局极小值,而小学习率则收敛至局部极小值。
  • 提供理论与实证证据,证明大学习率的影响是本质性的,无法仅通过增加随机性来复制。
  • 建立一种基于传统光滑性假设无法观测到的轨迹差异的优化算法分析框架。

提出的方法

  • 对一类具有局部极小值和全局极小值的非凸函数进行GD的理论分析,表明大学习率会导致轨迹偏离局部极小值。
  • 在合成非凸函数上,通过全批量GD比较大、小学习率的实验,观察逃逸行为。
  • 设计重复小批量的实验,以隔离学习率的影响,同时保持噪声幅度恒定。
  • 使用标准神经网络架构(如ResNet)训练,观察大学习率在实际中实现从局部极小值逃逸的现象。
  • 沿小学习率与大学习率轨迹之间的连线进行损失景观分析,可视化损失变化并确认逃逸行为。
  • 使用梯度流作为连续时间基线,与离散GD对比,凸显有限步长的作用。

实验结果

研究问题

  • RQ1SGD中大学习率的成功是否完全源于随机噪声的增加,还是存在学习率大小的内在效应?
  • RQ2全批量GD在大学习率下能否在小学习率GD失败的非凸函数中实现从局部极小值的逃逸?
  • RQ3通过增加随机噪声是否能复制大学习率的效果,同时保持学习率较小?
  • RQ4在非凸优化中,大学习率与小学习率的GD轨迹有何本质区别?
  • RQ5大学习率的理论优势是否能在实际神经网络训练中观察到?

主要发现

  • 在一类非凸函数上,全批量GD中的大学习率可实现从局部极小值的逃逸并收敛至全局极小值,而小学习率则收敛至局部极小值。
  • 大学习率的影响无法通过仅增加随机噪声来复制;实验显示,在固定小学习率但增加噪声幅度时,无法实现全局收敛。
  • 大学习率GD的轨迹与小学习率GD的轨迹在局部极小值附近存在显著差异。
  • 连接小学习率与大学习率轨迹之间的路径上,损失先上升(表明逃逸),后下降(表明收敛至全局极小值),证实了非单调行为。
  • 在实际神经网络训练中,大学习率可提升测试准确率,并能观察到从较差局部极小值的逃逸,即使在无随机噪声的情况下也是如此。
  • 大、小学习率行为差异无法被梯度流(无穷小步长)捕捉,凸显了离散步长在优化动力学中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。