Skip to main content
QUICK REVIEW

[论文解读] Momentum via Primal Averaging: Theoretical Insights and Learning Rate Schedules for Non-Convex Optimization

Aaron Defazio|arXiv (Cornell University)|Oct 1, 2020
Stochastic Gradient Optimization Techniques参考文献 26被引用 6
一句话总结

本文通过原始平均(PA)重参数化,对带动量的随机梯度下降(SGD+M)提出了一种新颖的李雅普诺夫分析,揭示了在非凸优化中动量加速收敛的精确条件。研究发现,学习率的突变会损害稳定性,并提出一种渐进式超参数调度策略,以维持收敛性并避免训练损失尖峰。

ABSTRACT

Momentum methods are now used pervasively within the machine learning community for training non-convex models such as deep neural networks. Empirically, they out perform traditional stochastic gradient descent (SGD) approaches. In this work we develop a Lyapunov analysis of SGD with momentum (SGD+M), by utilizing a equivalent rewriting of the method known as the stochastic primal averaging (SPA) form. This analysis is much tighter than previous theory in the non-convex case, and due to this we are able to give precise insights into when SGD+M may out-perform SGD, and what hyper-parameter schedules will work and why.

研究动机与目标

  • 提供比以往工作更紧密、更具洞察力的SGD+M在非凸设置下的李雅普诺夫分析。
  • 解释为何动量能加速优化,尤其是在训练初期。
  • 识别动量方法中标准突变式学习率调度策略的缺陷。
  • 提出一种新的渐进式超参数调度策略,以维持稳定性和性能。

提出的方法

  • 将SGD+M重参数化为随机原始平均(SPA)形式,引入辅助变量 $ z_k $ 作为算法的核心组件。
  • 对SPA形式应用李雅普诺夫函数分析,追踪 $ f(z_k) - f^* $ 和动量相关项的演化。
  • 推导出李雅普诺夫函数增量的上界,其中包含依赖于 $ \|x_k - x_{k-1}\|^2 $、$ \|g_k\|^2 $ 和梯度噪声 $ \sigma^2 $ 的项。
  • 利用SPA形式与标准SGD+M之间的等价性,推导出动量项有益或有害的条件。
  • 分析步长 $ \alpha_k $ 和动量 $ \beta_k $ 变化的影响,表明突变会破坏李雅普诺夫函数的稳定性。
  • 提出一种几何渐进式学习率与动量调度策略,其中 $ \eta $ 和 $ c $ 每步按小因子(如1.0005)调整,以避免不稳定性。

实验结果

研究问题

  • RQ1在非凸问题中,SGD+M的动量在何种条件下能提供相较于标准SGD的收敛优势?
  • RQ2为何SGD+M的标准分阶段学习率调度在实践中会导致训练损失尖峰?
  • RQ3学习率与动量参数的变化如何影响原始平均框架中李雅普诺夫函数的稳定性?
  • RQ4何种超参数调度策略可确保在原始平均形式下实现稳定收敛,而不破坏动量动力学?
  • RQ5原始平均形式能否提供比传统SGD+M分析更深层次的理论洞见,揭示动量方法的行为?

主要发现

  • 在原始平均形式下的李雅普诺夫分析表明,动量引入了依赖于 $ \|x_k - x_{k-1}\|^2 $ 的额外项,若超参数突变,可能导致不稳定性。
  • 学习率的突变降低会导致李雅普诺夫步长中 $ \|x_k - x_{k-1}\|^2 $ 项的系数变为正数,从而引发不稳定性与训练损失尖峰。
  • 渐进式调度策略——其中 $ \eta $ 和 $ c $ 每步按几何方式以小因子调整——可避免不稳定性,并保持 $ \|x_k - x_{k-1}\|^2 $ 项的负系数。
  • 当 $ c = 0.1 $ 且 $ \eta L = 0.1 $ 时,每步允许的最大乘法变化因子 $ r $ 约为 $ 1.01 $,可确保稳定性。
  • 在CIFAR-10和ImageNet上的实验结果表明,渐进式调度可避免训练损失尖峰,并保持与标准调度相当的最终测试准确率。
  • 分析表明,相较于减小 $ \alpha $(步长),渐进式减小 $ \beta $(动量)可能是更稳定的策略,但前提是必须渐进执行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。