Skip to main content
QUICK REVIEW

[论文解读] Finite-Time Analysis of Stochastic Gradient Descent under Markov Randomness

Thinh T. Doan, Lam M. Nguyen|arXiv (Cornell University)|Mar 24, 2020
Stochastic Gradient Optimization Techniques参考文献 19被引用 11
一句话总结

本文提供了当梯度从马尔可夫过程中采样时,随机梯度下降(SGD)的有限时间收敛性分析,表明其收敛速率与独立同分布(i.i.d.)采样下的速率仅相差一个对数因子。主要贡献在于在不假设迭代值有界或梯度有界的情况下建立了收敛性,而该对数因子与马尔可夫链的混合时间相关。

ABSTRACT

Motivated by broad applications in reinforcement learning and machine learning, this paper considers the popular stochastic gradient descent (SGD) when the gradients of the underlying objective function are sampled from Markov processes. This Markov sampling leads to the gradient samples being biased and not independent. The existing results for the convergence of SGD under Markov randomness are often established under the assumptions on the boundedness of either the iterates or the gradient samples. Our main focus is to study the finite-time convergence of SGD for different types of objective functions, without requiring these assumptions. We show that SGD converges nearly at the same rate with Markovian gradient samples as with independent gradient samples. The only difference is a logarithmic factor that accounts for the mixing time of the Markov chain.

研究动机与目标

  • 分析当梯度由马尔可夫过程生成时SGD的有限时间收敛性,该过程引入了偏差和依赖性。
  • 消除先前工作中常见的假设,如迭代值有界或梯度有界,这些假设在强化学习等场景中往往不现实。
  • 在马尔可夫采样下建立SGD的收敛速率,使其几乎与i.i.d.采样下的速率相当,仅因混合时间而存在对数惩罚。
  • 为多个目标函数类提供统一的分析:强凸函数、带误差界平滑函数,以及非凸平滑函数。

提出的方法

  • 采用一种新颖的李雅普诺夫型论证方法,以控制每轮迭代中目标函数值的期望下降量,同时考虑梯度中的马尔可夫依赖性。
  • 引入一种时变步长规则,α_k = α₀ / √k,以在收敛速度与噪声平均之间取得平衡。
  • 方法中引入了对最终迭代点 x_R 的随机选择规则,其概率与 2α_k − Lα_k² 成正比,以确保梯度范数的期望更优。
  • 利用底层马尔可夫链的混合时间来控制梯度样本的偏差与方差,从而在收敛界中引入一个对数因子。
  • 通过递推不等式和对迭代次数的求和,建立对期望梯度范数平方 ∥∇f(x_R)∥²_* 的界。
  • 证明依赖于 ∇f 的利普希茨连续性以及梯度样本的有界性假设,但避免了对有界迭代值或紧致可行集的假设。

实验结果

研究问题

  • RQ1当梯度从马尔可夫过程中采样时,SGD 是否能在存在依赖性和偏差的情况下实现接近最优的收敛速率?
  • RQ2马尔可夫链的混合时间如何影响SGD的收敛速率?
  • RQ3是否可以在不假设迭代值有界或梯度有界的情况下建立收敛性,尤其是在强化学习场景中?
  • RQ4在马尔可夫采样下,SGD 对于非凸、平滑及强凸目标函数的有限时间收敛速率是多少?

主要发现

  • 期望梯度范数平方 E[∥∇f(x_R)∥²_*] 的界为 O(1/√T) 加上对数项,与 i.i.d. SGD 的速率仅相差一个对数因子。
  • 收敛速率与 i.i.d. 情况相比仅相差一个对数因子,该因子取决于生成梯度的马尔可夫链的混合时间。
  • 该分析无需假设迭代值有界或梯度有界,因此适用于如强化学习等此类假设常不成立的场景。
  • 对于非凸平滑目标函数,该方法实现了 E[∥∇f(x_R)∥²_*] ≤ O(1/√T),其中对数惩罚由混合时间引入。
  • 该界包含与初始到最优集距离以及梯度样本方差相关的项,这两者均通过步长和混合时间加以控制。
  • 最终迭代点 x_R 以非均匀概率选择,其概率与 2α_k − Lα_k² 成正比,相比均匀选择,该策略可提供更优的收敛保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。