[论文解读] Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training
本文提出了一种新型优化方法——带动量的随机归一化梯度下降(SNGM),该方法将归一化梯度下降与Polyak动量相结合,实现了深度学习中高效的大批量训练。SNGM在理论上实现了以低于动量SGD的计算复杂度收敛至ϵ-驻点,从而在不依赖预热或学习率缩放启发式策略的情况下,实现了更快的训练速度和最先进的测试准确率,即使在大批次设置下亦能保持优异性能。
Stochastic gradient descent~(SGD) and its variants have been the dominating optimization methods in machine learning. Compared to SGD with small-batch training, SGD with large-batch training can better utilize the computational power of current multi-core systems such as graphics processing units~(GPUs) and can reduce the number of communication rounds in distributed training settings. Thus, SGD with large-batch training has attracted considerable attention. However, existing empirical results showed that large-batch training typically leads to a drop in generalization accuracy. Hence, how to guarantee the generalization ability in large-batch training becomes a challenging task. In this paper, we propose a simple yet effective method, called stochastic normalized gradient descent with momentum~(SNGM), for large-batch training. We prove that with the same number of gradient computations, SNGM can adopt a larger batch size than momentum SGD~(MSGD), which is one of the most widely used variants of SGD, to converge to an $ε$-stationary point. Empirical results on deep learning verify that when adopting the same large batch size, SNGM can achieve better test accuracy than MSGD and other state-of-the-art large-batch training methods.
研究动机与目标
- 为解决在大规模SGD训练中常见的泛化准确率下降问题,尤其是在深度神经网络中。
- 开发一种理论基础扎实的优化方法,在使用大批次的同时保持高测试准确率。
- 通过减少达到收敛所需的参数更新次数,提升训练效率。
- 对松弛光滑非凸目标函数的收敛复杂度提供理论分析,弥补先前研究的空白。
提出的方法
- SNGM将归一化梯度下降与Polyak动量相结合,其中更新方向通过梯度范数的倒数进行缩放,以稳定优化过程。
- 该方法使用累积归一化梯度方向的动量项,提升了在高批次设置下的收敛稳定性。
- SNGM通过梯度归一化机制内在地稳定训练,从而避免了启发式学习率缩放和预热策略。
- 该算法专为大批次训练设计,在松弛光滑性假设下具备收敛复杂度的理论保证。
- 其采用多项式幂次学习率调度策略,并结合梯度累积,以在使用极大批量时维持训练稳定性。
- 理论分析表明,SNGM在松弛光滑目标函数下实现了O(1/ε⁴)的计算复杂度,这是随机优化领域的一项新成果。
实验结果
研究问题
- RQ1在使用大批次时,带有动量的归一化梯度方法是否能比标准动量SGD实现更好的泛化性能?
- RQ2在相同批次大小下,SNGM是否能以低于动量SGD的计算复杂度收敛至ϵ-驻点?
- RQ3SNGM是否能在不依赖预热或学习率缩放等启发式技术的情况下,实现大规模训练下的最先进测试准确率?
- RQ4在松弛光滑性假设下,随机优化方法的理论收敛复杂度是多少?
主要发现
- 在CIFAR10上,SNGM在批量大小为4096时,ResNet20的测试准确率达到91.42%,与小批量大小为128的MSGD的91.63%准确率相当。
- 在ResNet56上,SNGM在批量大小为4096时达到93.12%的测试准确率,优于MSGD的88.55%和使用预热的LARS的92.98%。
- 在ImageNet上,SNGM在批量大小为8192时,ResNet18的top-1准确率达到69.65%,ResNet50达到75.42%,与小批量下MSGD的69.71%和75.70%非常接近。
- SNGM在未使用预热或学习率缩放的情况下实现了这些结果,而LARS等其他方法则依赖这些技术,体现了SNGM的鲁棒性。
- 理论分析确认,SNGM在松弛光滑目标函数下实现了O(1/ε⁴)的计算复杂度,这是随机优化领域的一项新成果。
- SNGM可在与MSGD相同的计算复杂度下,采用比MSGD更大的批量大小收敛至相同的ϵ-驻点,意味着其收敛速度更快。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。