Skip to main content
QUICK REVIEW

[论文解读] Strength of Minibatch Noise in SGD

Liu Ziyin, Kangqiao Liu|arXiv (Cornell University)|Feb 10, 2021
Stochastic Gradient Optimization Techniques参考文献 42被引用 8
一句话总结

本文首次对深度学习中随机梯度下降(SGD)的最小批量噪声进行了系统性分析,推导出在任意学习率下的离散时间SGD中噪声强度与参数波动的精确解析公式。研究发现,最小批量噪声在不同类型的极小值点之间存在显著差异,并表明大学习率会引入隐式正则化,解释了泛化性能的提升以及线性学习率-批量大小缩放法则在极端设置下的失效原因。

ABSTRACT

The noise in stochastic gradient descent (SGD), caused by minibatch sampling, is poorly understood despite its practical importance in deep learning. This work presents the first systematic study of the SGD noise and fluctuations close to a local minimum. We first analyze the SGD noise in linear regression in detail and then derive a general formula for approximating SGD noise in different types of minima. For application, our results (1) provide insight into the stability of training a neural network, (2) suggest that a large learning rate can help generalization by introducing an implicit regularization, (3) explain why the linear learning rate-batchsize scaling law fails at a large learning rate or at a small batchsize and (4) can provide an understanding of how discrete-time nature of SGD affects the recently discovered power-law phenomenon of SGD.

研究动机与目标

  • 为解决离散时间SGD在有限学习率下最小批量噪声缺乏理论理解的问题。
  • 推导SGD噪声强度与形状在局部极小值附近的精确解析表达式。
  • 解释为何大学习率能改善泛化性能,以及为何线性学习率-批量大小缩放法则在极端条件下会失效。
  • 阐明SGD的离散时间特性如何影响在训练动态中观察到的幂律行为。

提出的方法

  • 针对可解情形下的线性回归,推导SGD噪声与参数波动的精确解析解。
  • 提出一种通用公式,利用矩阵分解与迹近似方法,用于近似不同类型极小值点中的最小批量噪声协方差。
  • 以连续时间极限与Hessian近似为基准,验证新提出的离散时间框架。
  • 将推导出的噪声模型应用于一维及高维情形下,分析训练/测试损失、参数波动与收敛条件。
  • 提出一种基于迹的近似方法,用于渐近噪声协方差与参数波动,整合学习率与批量大小的影响。
  • 通过理论分析与一维及高维情形下可交换矩阵的数值验证,对结果进行验证。

实验结果

研究问题

  • RQ1SGD中最小批量噪声的强度与形状在不同类型的局部极小值点之间如何变化?
  • RQ2在任意学习率下的离散时间SGD中,参数波动的精确解析形式是什么?
  • RQ3为何学习率与批量大小之间的线性缩放法则在学习率过大或批量太小时会失效?
  • RQ4SGD的离散时间特性如何影响在训练动态中观察到的幂律行为?
  • RQ5学习率在通过最小批量噪声诱导隐式正则化中扮演何种角色?

主要发现

  • SGD中的最小批量噪声并非在所有情况下都可由Hessian近似,其形式取决于局部极小值的类型,这在某些情形下否定了常见的Hessian近似方法。
  • 大学习率通过改变噪声结构引入隐式正则化,解释了实践中泛化性能的提升。
  • 当学习率过大或批量太小时,线性学习率-批量大小缩放法则会失效,原因是噪声协方差中的非线性效应未被标准近似方法捕捉。
  • SGD的离散时间特性导致参数波动表现出类似幂律的行为,而这种现象无法由连续时间近似解释。
  • 在一维SGD中,负的最优正则化参数γ存在的必要条件是批量大小S ≠ 2,且学习率必须满足一个涉及S与模型参数的非平凡边界条件。
  • 所推导的参数波动Σ的解析公式综合考虑了学习率、批量大小与曲率,相比连续时间或基于Hessian的近似,提供了更精确的描述。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。