Skip to main content
QUICK REVIEW

[论文解读] Closing the convergence gap of SGD without replacement

Shashank Rajput, Anant Gupta|arXiv (Cornell University)|Feb 24, 2020
Stochastic Gradient Optimization Techniques被引用 10
一句话总结

该论文通过证明强凸二次函数下最优收敛率为 $\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$,填补了无放回随机梯度下降(SGDo)理论收敛性的空白,与已知的最佳下界完全匹配。此外,该研究还为一般光滑强凸函数建立了新的 $\Omega\left(\frac{n}{T^2}\right)$ 下界,解决了长期以来关于 SGDo 收敛理论的不确定性问题。

ABSTRACT

Stochastic gradient descent without replacement sampling is widely used in practice for model training. However, the vast majority of SGD analyses assumes data is sampled with replacement, and when the function minimized is strongly convex, an $\mathcal{O}\left(\frac{1}{T} ight)$ rate can be established when SGD is run for $T$ iterations. A recent line of breakthrough works on SGD without replacement (SGDo) established an $\mathcal{O}\left(\frac{n}{T^2} ight)$ convergence rate when the function minimized is strongly convex and is a sum of $n$ smooth functions, and an $\mathcal{O}\left(\frac{1}{T^2}+\frac{n^3}{T^3} ight)$ rate for sums of quadratics. On the other hand, the tightest known lower bound postulates an $Ω\left(\frac{1}{T^2}+\frac{n^2}{T^3} ight)$ rate, leaving open the possibility of better SGDo convergence rates in the general case. In this paper, we close this gap and show that SGD without replacement achieves a rate of $\mathcal{O}\left(\frac{1}{T^2}+\frac{n^2}{T^3} ight)$ when the sum of the functions is a quadratic, and offer a new lower bound of $Ω\left(\frac{n}{T^2} ight)$ for strongly convex functions that are sums of smooth functions.

研究动机与目标

  • 填补强凸设定下无放回随机梯度下降(SGDo)的上界与下界之间的理论收敛性差距。
  • 为 SGDo 在目标函数为二次函数或光滑函数时的收敛速率建立紧致的上下界。
  • 解决关于现有 SGDo 上界是否松散或信息论上最优的开放性问题。
  • 为作为光滑分量之和的强凸函数提供新的 $\Omega\left(\frac{n}{T^2}\right)$ 下界。

提出的方法

  • 在标准假设下分析 SGDo 的收敛性:强凸性、光滑性以及梯度有界性。
  • 利用集中与鞅论证,推导出二次目标函数的上界 $\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$。
  • 基于先前工作中的一维函数构造新型下界实例,并将其扩展至二维以展示最坏情况行为。
  • 采用二维构造,其中每个坐标分量在 SGDo 下独立演化,从而实现对各维度收敛性的独立分析。
  • 应用条件期望与尾概率界来控制迭代点的偏离,并推导误差下界。
  • 结合先前工作(如 HaoChen & Sra、Nagaraj 等)与新技术引理,进一步收紧边界。

实验结果

研究问题

  • RQ1SGDo 在二次函数上的 $\tilde{\mathcal{O}}\left(\frac{1}{T^2} + \frac{n^3}{T^3}\right)$ 上界是否紧致,或可进一步改进?
  • RQ2SGDo 在作为光滑分量之和的强凸函数上的信息论最优收敛率是多少?
  • RQ3能否在一般光滑强凸情况下为 SGDo 建立与最佳已知上界匹配的下界?
  • RQ4SGDo 相较于有放回 SGD 的经验优越性,是否在收敛率理论上具有理论基础?

主要发现

  • 该论文为 SGDo 在目标函数为二次函数之和时建立了紧致上界 $\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$,填补了与已知下界之间的差距。
  • 为作为光滑分量之和的强凸函数证明了新的下界 $\Omega\left(\frac{n}{T^2}\right)$,该下界与该类函数中最佳已知上界完全匹配。
  • 二次函数的上界改进了先前的最先进结果 $\tilde{\mathcal{O}}\left(\frac{1}{T^2} + \frac{n^3}{T^3}\right)$,将 $n^3$ 项降低至 $n^2$。
  • 结果表明,SGDo 在二次函数与一般光滑强凸函数设定下均实现了信息论上最优的收敛速率。
  • 分析证实,SGDo 相较于有放回 SGD 的经验性能优势在收敛率理论上是成立的。
  • 下界证明中的构造使用了先前工作中一维函数的二维扩展,表明至少一个坐标分量的误差必须达到 $\Omega\left(\frac{G^2 n}{T^2}\right)$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。