Skip to main content
QUICK REVIEW

[论文解读] Better SGD using Second-order Momentum

Hoang Vu Tran, Ashok Cutkosky|arXiv (Cornell University)|Mar 4, 2021
Stochastic Gradient Optimization Techniques参考文献 25被引用 4
一句话总结

本文提出SGDHess,一种新颖的随机优化算法,通过引入Hessian-向量乘积来校正SGD中的动量偏差,从而在非凸设置下实现寻找$\epsilon$-临界点的最优$O(\epsilon^{-3})$收敛速率。与以往的二阶方法不同,该方法避免了大批次大小,并支持自适应学习率,显著提升了在深度学习基准上的实用性与性能。

ABSTRACT

We develop a new algorithm for non-convex stochastic optimization that finds an $ε$-critical point in the optimal $O(ε^{-3})$ stochastic gradient and Hessian-vector product computations. Our algorithm uses Hessian-vector products to "correct" a bias term in the momentum of SGD with momentum. This leads to better gradient estimates in a manner analogous to variance reduction methods. In contrast to prior work, we do not require excessively large batch sizes, and are able to provide an adaptive algorithm whose convergence rate automatically improves with decreasing variance in the gradient estimates. We validate our results on a variety of large-scale deep learning architectures and benchmarks tasks.

研究动机与目标

  • 开发一种实用的二阶优化方法,在非凸深度学习设置中实现超越标准SGD的收敛性能。
  • 减少为找到$\epsilon$-临界点所需的随机梯度和Hessian-向量预言机调用次数。
  • 避免依赖大批次大小,这在以往的二阶方法中较为常见。
  • 设计一种自适应变体,当梯度噪声较低时能自动提升收敛性能。
  • 在多种深度学习架构和任务上对方法进行实证验证。

提出的方法

  • 该算法通过引入Hessian-向量乘积来校正SGD动量中的偏差项,从而改进梯度估计。
  • 使用李雅普诺夫函数$\Phi_t$追踪进展并推导收敛界,同时整合梯度项与误差项。
  • 采用递减的学习率调度$\eta_t$,以平衡探索与收敛。
  • 归一化变体消除了对Lipschitz梯度假设的依赖,增强了鲁棒性。
  • 自适应版本根据观测到的梯度方差动态调整学习率,在低噪声条件下实现$O(\epsilon^{-2})$的收敛速率。
  • 理论分析基于利用Hessian-向量乘积与梯度噪声的性质,对李雅普诺夫函数的期望下降量进行有界控制。

实验结果

研究问题

  • RQ1能否在不使用大批次大小的前提下,利用Hessian-向量乘积改进非凸优化中SGD的收敛性?
  • RQ2通过Hessian-向量乘积引入二阶信息,是否能实现比标准SGD更快的收敛速率?
  • RQ3当梯度噪声降低时,该算法能否自适应地提升收敛性能?
  • RQ4所提方法在多种深度学习架构和任务中是否具有实际有效性?
  • RQ5该算法能否实现寻找$\epsilon$-临界点的理论下界$O(\epsilon^{-3})$次预言机调用?

主要发现

  • 所提出的SGDHess算法在非凸随机优化中实现了寻找$\epsilon$-临界点的最优$O(\epsilon^{-3})$收敛速率。
  • 该方法无需大批次大小,与许多先前的二阶方法不同,因此在大规模学习中更具实用性。
  • 该算法的自适应变体在梯度噪声可忽略时实现了更快的$O(\epsilon^{-2})$收敛速率。
  • 该算法的归一化版本消除了对Lipschitz梯度假设的依赖,扩大了其适用范围。
  • 实证结果表明,该方法在多个深度学习基准和架构上均表现出一致的性能提升,通常与或超过当前最先进方法。
  • 调参过程简单,许多超参数可直接从标准SGD迁移使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。