Skip to main content
QUICK REVIEW

[论文解读] On the Convergence of Stochastic Gradient Descent with Bandwidth-based Step Size

Xiaoyu Wang, Ya-xiang Yuan|arXiv (Cornell University)|Feb 17, 2021
Stochastic Gradient Optimization Techniques参考文献 45被引用 5
一句话总结

本文提出了一种基于带宽的随机梯度下降(SGD)步长框架,其中步长被限制在随时间衰减的上下界之间。在温和条件下建立了非渐近收敛速率,表明对于各种步长策略(包括非单调的如 $1/t$ 上下和循环调度),收敛速率达到最优的 $\mathcal{O}(1/T)$ 和 $\mathcal{O}(\log T / T)$。

ABSTRACT

We investigate the stochastic gradient descent (SGD) method where the step size lies within a banded region instead of being given by a fixed formula. The optimal convergence rate under mild conditions and large initial step size is proved. Our analysis provides comparable theoretical error bounds for SGD associated with a variety of step sizes. In addition, the convergence rates for some existing step size strategies, e.g., triangular policy and cosine-wave, can be revealed by our analytical framework under the boundary constraints. The bandwidth-based step size provides efficient and flexible step size selection in optimization. We also propose a $1/t$ up-down policy and give several non-monotonic step sizes. Numerical experiments demonstrate the efficiency and significant potential of the bandwidth-based step-size in many applications.

研究动机与目标

  • 分析当步长位于随时间变化的带状区域内而非遵循固定调度时SGD的收敛性。
  • 在温和假设下建立SGD的非渐近收敛速率,包括初始步长较大和梯度噪声有界的情况。
  • 将现有的非单调步长策略(如三角形、余弦波和分段衰减策略)统一并纳入一个理论框架中进行分析。
  • 提出一种新颖的 $1/t$ 上下步长策略,并证明其收敛性质。
  • 为各类步长族(包括自适应和循环调度)提供与现有最佳结果相当的理论误差界。

提出的方法

  • 引入基于带宽的步长约束:$ m\delta_1(t) \leq \eta(t) \leq M\delta_2(t) $,其中 $ \delta_1(t), \delta_2(t) $ 为非增函数。
  • 采用李雅普诺夫函数方法推导到最优解距离的期望平方的界 $ \mathbb{E}[\|x_t - x^*\|^2] $。
  • 应用涉及步长与梯度噪声方差的递推不等式,推导收敛速率。
  • 利用积分和对数界分析不同带宽函数下误差项的衰减。
  • 通过平衡步长衰减与梯度噪声累积效应,推导收敛速率。
  • 通过验证已知策略(如 $1/t$、余弦、三角形)满足带宽约束并达到已知速率,验证该框架的有效性。

实验结果

研究问题

  • RQ1能否构建一个统一的理论框架,用于分析SGD中非单调和非固定步长策略?
  • RQ2当步长位于时变带状区域内时,SGD的收敛速率可保证为多少?
  • RQ3现有步长策略(如循环学习率或分段衰减)如何融入这一基于带宽的框架?
  • RQ4能否在此框架下设计并证明新型非单调步长策略(如 $1/t$ 上下)的收敛性?
  • RQ5在梯度噪声有界条件下,初始步长大小与收敛速率之间最优权衡为何?

主要发现

  • 在适当的带宽条件下,基于带宽的框架对强凸且 $L$-光滑函数实现了最优的 $\mathcal{O}(1/T)$ 收敛速率。
  • 对于满足 $ \eta(t) \in [m/(t+1)\ln(t+1), M/(t+1)^\alpha] $ 且 $ \alpha \in (1/2,1] $ 的步长,收敛速率为 $ \mathcal{O}(1/(\ln T)^{\tau\mu m}) $,该速率虽为次多项式,但快于任意 $ \epsilon > 0 $ 的 $ \mathcal{O}(1/T^\epsilon) $。
  • 该框架恢复并解释了现有策略的收敛行为:三角形和余弦波调度被证明满足带宽约束并达到已知误差界。
  • 所提出的 $1/t$ 上下策略在带宽模型下被证明收敛,展示了步长设计的灵活性。
  • 数值实验验证了在多种机器学习应用中,基于带宽的步长在效率和实际潜力方面表现优异。
  • 该分析提供了与现有最佳结果相当的非渐近误差界,即使对于非单调步长亦成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。