Skip to main content
QUICK REVIEW

[论文解读] The convergence of the Stochastic Gradient Descent (SGD) : a self-contained proof

Gabriel Turinici|arXiv (Cornell University)|Mar 26, 2021
Markov Chains and Monte Carlo Methods参考文献 5被引用 4
一句话总结

本文提供了在强凸性和梯度矩条件下,随机梯度下降(SGD)收敛性的自包含、教学性质的证明。当步长序列满足 $ \rho_n \to 0 $ 且 $ \sum \rho_n = \infty $ 时,证明了迭代序列在 $ L^2 $ 范数下收敛到真实最小值,给出了明确的误差界和衰减率分析。

ABSTRACT

We give here a proof of the convergence of the Stochastic Gradient Descent (SGD) in a self-contained manner.

研究动机与目标

  • 提供一个完整且易于理解的 SGD 收敛性证明,无需依赖外部参考文献。
  • 形式化 SGD 在期望意义下收敛到全局最小值的收敛条件。
  • 阐明学习率调度在确保迭代序列 $ L^2 $ 收敛中的作用。
  • 提供一个适合教学或在机器学习场景中实现 SGD 的教学框架。

提出的方法

  • 形式化 SGD 更新规则:$ X_{n+1} = X_n - \rho_n \nabla_X L(\omega_n, X_n) $,其中 $ \omega_n $ 为独立同分布的随机样本。
  • 施加两个关键假设:二阶梯度矩有界,即 $ \mathbb{E}[\|\nabla_X L(\omega,X)\|^2] \leq C_0 + C_1\|X\|^2 $,以及期望损失 $ \mathcal{L}(X) $ 的强凸性。
  • 推导出到最优解的期望平方距离的递推不等式:$ d_{n+1} \leq (1 - \rho_n\mu + \rho_n^2 c_1) d_n + \rho_n^2 c_0 $。
  • 采用李雅普诺夫风格论证,证明在 $ \rho_n \to 0 $ 且 $ \sum \rho_n = \infty $ 条件下 $ d_n \to 0 $,并借助乘积不等式引理。
  • 应用对乘积 $ \prod (1 - \rho_\ell \xi) \to 0 $ 的对数界,证明渐近收敛性。
  • 通过迭代压缩论证和 $ \epsilon $-极限分析处理非恒定步长。

实验结果

研究问题

  • RQ1在何种条件下,SGD 会以 $ L^2 $ 收敛到强凸期望损失函数的全局最小值?
  • RQ2学习率调度如何影响 SGD 中的收敛速率和最终误差界?
  • RQ3梯度矩有界性在确保 SGD 的稳定性和收敛性中起什么作用?
  • RQ4能否在不依赖高级随机过程理论的前提下,构建一个自包含的 SGD 收敛性证明?

主要发现

  • 当学习率序列满足 $ \rho_n \to 0 $ 且 $ \sum_{n \geq 1} \rho_n = \infty $ 时,到最小值的期望平方距离 $ d_n = \mathbb{E}[\|X_n - X_*\|^2] $ 收敛于零。
  • 对于常数学习率 $ \rho_n = \rho $,$ d_n $ 的 $ \limsup $ 可被控制在 $ \epsilon $ 以内,只要 $ \rho $ 足够小,从而确保收敛到最优解的 $ \epsilon $-邻域。
  • 收敛速率由不等式 $ d_{n+1} \leq (1 - \rho_n\mu + \rho_n^2 c_1) d_n + \rho_n^2 c_0 $ 决定,其中 $ c_0, c_1 $ 由梯度矩有界性推导得出。
  • 证明表明 $ \lim_{k \to \infty} \prod_{\ell=n}^{n+k} (1 - \rho_\ell \mu / 2) = 0 $,这在给定的步长条件下确保了渐近收敛性。
  • 即使损失函数非光滑,只要在不可微点使用次梯度(例如 ReLU 激活函数),该结果仍然成立。
  • 分析确认 $ \sum \rho_n = \infty $ 是收敛到精确最小值的必要条件,有限和的情形存在反例。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。