Skip to main content
QUICK REVIEW

[论文解读] Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training

Shen-Yi Zhao, Shi Chen|arXiv (Cornell University)|Jul 28, 2020
Stochastic Gradient Optimization Techniques参考文献 17被引用 4
一句话总结

本文提出了一种新型优化方法——带动量的随机归一化梯度下降(SNGM),该方法将归一化梯度下降与Polyak动量相结合,实现了深度学习中高效的大批量训练。SNGM在理论上实现了以低于动量SGD的计算复杂度收敛至ϵ-驻点,从而在不依赖预热或学习率缩放启发式策略的情况下,实现了更快的训练速度和最先进的测试准确率,即使在大批次设置下亦能保持优异性能。

ABSTRACT

Stochastic gradient descent~(SGD) and its variants have been the dominating optimization methods in machine learning. Compared to SGD with small-batch training, SGD with large-batch training can better utilize the computational power of current multi-core systems such as graphics processing units~(GPUs) and can reduce the number of communication rounds in distributed training settings. Thus, SGD with large-batch training has attracted considerable attention. However, existing empirical results showed that large-batch training typically leads to a drop in generalization accuracy. Hence, how to guarantee the generalization ability in large-batch training becomes a challenging task. In this paper, we propose a simple yet effective method, called stochastic normalized gradient descent with momentum~(SNGM), for large-batch training. We prove that with the same number of gradient computations, SNGM can adopt a larger batch size than momentum SGD~(MSGD), which is one of the most widely used variants of SGD, to converge to an $ε$-stationary point. Empirical results on deep learning verify that when adopting the same large batch size, SNGM can achieve better test accuracy than MSGD and other state-of-the-art large-batch training methods.

研究动机与目标

  • 为解决在大规模SGD训练中常见的泛化准确率下降问题,尤其是在深度神经网络中。
  • 开发一种理论基础扎实的优化方法,在使用大批次的同时保持高测试准确率。
  • 通过减少达到收敛所需的参数更新次数,提升训练效率。
  • 对松弛光滑非凸目标函数的收敛复杂度提供理论分析,弥补先前研究的空白。

提出的方法

  • SNGM将归一化梯度下降与Polyak动量相结合,其中更新方向通过梯度范数的倒数进行缩放,以稳定优化过程。
  • 该方法使用累积归一化梯度方向的动量项,提升了在高批次设置下的收敛稳定性。
  • SNGM通过梯度归一化机制内在地稳定训练,从而避免了启发式学习率缩放和预热策略。
  • 该算法专为大批次训练设计,在松弛光滑性假设下具备收敛复杂度的理论保证。
  • 其采用多项式幂次学习率调度策略,并结合梯度累积,以在使用极大批量时维持训练稳定性。
  • 理论分析表明,SNGM在松弛光滑目标函数下实现了O(1/ε⁴)的计算复杂度,这是随机优化领域的一项新成果。

实验结果

研究问题

  • RQ1在使用大批次时,带有动量的归一化梯度方法是否能比标准动量SGD实现更好的泛化性能?
  • RQ2在相同批次大小下,SNGM是否能以低于动量SGD的计算复杂度收敛至ϵ-驻点?
  • RQ3SNGM是否能在不依赖预热或学习率缩放等启发式技术的情况下,实现大规模训练下的最先进测试准确率?
  • RQ4在松弛光滑性假设下,随机优化方法的理论收敛复杂度是多少?

主要发现

  • 在CIFAR10上,SNGM在批量大小为4096时,ResNet20的测试准确率达到91.42%,与小批量大小为128的MSGD的91.63%准确率相当。
  • 在ResNet56上,SNGM在批量大小为4096时达到93.12%的测试准确率,优于MSGD的88.55%和使用预热的LARS的92.98%。
  • 在ImageNet上,SNGM在批量大小为8192时,ResNet18的top-1准确率达到69.65%,ResNet50达到75.42%,与小批量下MSGD的69.71%和75.70%非常接近。
  • SNGM在未使用预热或学习率缩放的情况下实现了这些结果,而LARS等其他方法则依赖这些技术,体现了SNGM的鲁棒性。
  • 理论分析确认,SNGM在松弛光滑目标函数下实现了O(1/ε⁴)的计算复杂度,这是随机优化领域的一项新成果。
  • SNGM可在与MSGD相同的计算复杂度下,采用比MSGD更大的批量大小收敛至相同的ϵ-驻点,意味着其收敛速度更快。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。