Skip to main content
QUICK REVIEW

[论文解读] Scheduled Restart Momentum for Accelerated Stochastic Gradient Descent

Bao Wang, Tan M. Nguyen|arXiv (Cornell University)|Feb 24, 2020
Stochastic Gradient Optimization Techniques被引用 5
一句话总结

该论文提出了一种新型优化算法——计划重启随机梯度下降(SRSGD),通过将Nesterov加速动量与周期性动量重置相结合,以稳定训练过程并加速深度神经网络的收敛。通过用随时间递增的Nesterov动量(每固定迭代次数重置一次)替代恒定动量,SRSGD实现了更快的收敛速度和更优的泛化性能,在ResNet200上将ImageNet错误率从基线SGD的22.13%降低至20.93%。

ABSTRACT

Stochastic gradient descent (SGD) with constant momentum and its variants such as Adam are the optimization algorithms of choice for training deep neural networks (DNNs). Since DNN training is incredibly computationally expensive, there is great interest in speeding up the convergence. Nesterov accelerated gradient (NAG) improves the convergence rate of gradient descent (GD) for convex optimization using a specially designed momentum; however, it accumulates error when an inexact gradient is used (such as in SGD), slowing convergence at best and diverging at worst. In this paper, we propose Scheduled Restart SGD (SRSGD), a new NAG-style scheme for training DNNs. SRSGD replaces the constant momentum in SGD by the increasing momentum in NAG but stabilizes the iterations by resetting the momentum to zero according to a schedule. Using a variety of models and benchmarks for image classification, we demonstrate that, in training DNNs, SRSGD significantly improves convergence and generalization; for instance in training ResNet200 for ImageNet classification, SRSGD achieves an error rate of 20.93% vs. the benchmark of 22.13%. These improvements become more significant as the network grows deeper. Furthermore, on both CIFAR and ImageNet, SRSGD reaches similar or even better error rates with significantly fewer training epochs compared to the SGD baseline.

研究动机与目标

  • 解决在深度学习中使用近似梯度时,Nesterov加速随机梯度下降(NASGD)因不稳定性和误差累积导致的问题。
  • 克服SGD中恒定动量的局限性,后者在实践中无法实现Nesterov方法的最优O(1/k²)收敛速率。
  • 开发一种实用的优化算法,结合Nesterov动量的快速收敛特性与周期性重置的稳定性。
  • 在深度网络中,特别是在更深的架构中,显著提升训练速度与模型准确率。
  • 对NASGD中的误差累积现象进行理论分析,并为SRSGD提供收敛性保证。

提出的方法

  • 引入一种计划重启机制,每固定次数迭代后将动量重置为零,从而在随机设置下稳定Nesterov动量。
  • 用随时间变化的Nesterov动量系数μ_k = (k-1)/(k+2) 替代SGD中的恒定动量,使其随时间递增以加速收敛。
  • 实现循环动量更新:v^{k+1} = w^k - s_k ∇f(w^k),w^{k+1} = v^{k+1} + μ_k (v^{k+1} - v^k),并周期性重置动量缓冲区。
  • 设计一种随训练进度自适应的学习率与动量调度策略,动量在用户定义的迭代次数后重置。
  • 将算法集成至PyTorch与Keras框架中,采用模块化实现,便于在深度学习流水线中快速部署。
  • 使用动量缓冲区追踪前一时刻的速度,从而高效计算Nesterov风格的前瞻更新。

实验结果

研究问题

  • RQ1在深度学习的随机梯度下降中,尽管Nesterov加速动量易受近似梯度影响而累积误差,是否仍可通过其机制实现稳定?
  • RQ2与恒定动量或Adam相比,周期性动量重置是否能提升深度神经网络训练的收敛速度与泛化性能?
  • RQ3SRSGD在CIFAR-10与ImageNet等标准图像分类基准上的表现如何,特别是在更深网络中的表现?
  • RQ4重启间隔对训练稳定性与最终模型准确率有何影响?
  • RQ5SRSGD是否能在更少训练轮次内实现更快收敛,同时保持或提升测试准确率,相较于SGD与Adam?

主要发现

  • 在ResNet200上,SRSGD将ImageNet分类的top-1错误率从基线SGD的22.13%降低至20.93%,显著提升了泛化性能。
  • 在CIFAR-10与CIFAR-100上,SRSGD在显著更少的训练轮次下,实现了与SGD和Adam相当或更优的测试准确率。
  • 随着网络深度的增加,SRSGD的性能优势愈发明显,表明其在更深架构中具有更强的收益。
  • SRSGD成功稳定了随机设置下的Nesterov动量机制,防止了标准NASGD中观察到的发散与误差累积现象。
  • 该算法实现了更快的收敛,由于自适应动量调度,训练能在更少迭代次数内达到更低的损失值。
  • 计划重启机制有效平衡了加速与稳定性,使Nesterov动量在真实世界深度学习训练中具备实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。