Skip to main content
QUICK REVIEW

[论文解读] SGD without Replacement: Sharper Rates for General Smooth Convex Functions

Prateek Jain, Nagaraj, Dheeraj|arXiv (Cornell University)|Mar 4, 2019
Stochastic Gradient Optimization Techniques参考文献 15被引用 10
一句话总结

该论文首次对一般光滑、强凸函数的无放回随机梯度下降(SGDo)进行了非渐近收敛分析,采用交换对方法界定了 Wasserstein 距离。在标准光滑性和强凸性假设下,无需 Hessian Lipschitz 假设,该工作建立了 $\widetilde{O}(1/nK^2)$ 的收敛速率——优于 SGD 的 $O(1/nK)$ 速率。

ABSTRACT

We study stochastic gradient descent {\em without replacement} (\sgdwor) for smooth convex functions. \sgdwor is widely observed to converge faster than true \sgd where each sample is drawn independently {\em with replacement} \cite{bottou2009curiously} and hence, is more popular in practice. But it's convergence properties are not well understood as sampling without replacement leads to coupling between iterates and gradients. By using method of exchangeable pairs to bound Wasserstein distance, we provide the first non-asymptotic results for \sgdwor when applied to {\em general smooth, strongly-convex} functions. In particular, we show that \sgdwor converges at a rate of $O(1/K^2)$ while \sgd is known to converge at $O(1/K)$ rate, where $K$ denotes the number of passes over data and is required to be {\em large enough}. Existing results for \sgdwor in this setting require additional {\em Hessian Lipschitz assumption} \cite{gurbuzbalaban2015random,haochen2018random}. For {\em small} $K$, we show \sgdwor can achieve same convergence rate as \sgd for {\em general smooth strongly-convex} functions. Existing results in this setting require $K=1$ and hold only for generalized linear models \cite{shamir2016without}. In addition, by careful analysis of the coupling, for both large and small $K$, we obtain better dependence on problem dependent parameters like condition number.

研究动机与目标

  • 为解决实践中无放回随机梯度下降(SGDo)与理论上放回随机梯度下降(SGD)之间的理论差距,后者已知收敛更慢。
  • 在标准假设下(光滑性、强凸性、Lipschitz 梯度)建立 SGDo 的更紧致、非渐近收敛速率。
  • 改进先前结果,后者需额外的 Hessian Lipschitz 条件,或仅限于广义线性模型或 $K=1$ 的情形。
  • 分析大 $K$ 和小 $K$ 两种情形,表明 SGDo 的收敛速率取决于遍历次数 $K$,可匹配或优于 SGD。
  • 提出一种基于最优传输(交换对)的耦合技术,以处理无放回采样引入的依赖性。

提出的方法

  • 使用交换对方法界定了 SGDo 与 SGD 的迭代之间 Wasserstein 距离,从而能够比较两者的收敛行为。
  • 在最后 $K/2$ 次遍历上应用后缀平均方案,以提升收敛速率并降低方差。
  • 利用强凸性和光滑性性质,推导出到最优解距离平方的递归界,即 $\mathbb{E}[\|x_k - x^*\|^2]$。
  • 采用步长 $\alpha = \Theta(\log(nK)/(\mu nK))$,以在收敛速率中平衡偏差与方差。
  • 分析了无放回采样下梯度与迭代之间的耦合关系,该关系引入了标准 SGD 中不存在的依赖性。
  • 利用凸性和梯度 Lipschitz 条件,将次优性 $\mathbb{E}[F(x) - F(x^*)]$ 以问题相关参数(如条件数 $\kappa$)的形式界出。

实验结果

研究问题

  • RQ1SGDo 是否能在不依赖 Hessian Lipschitz 连续性的前提下,对一般光滑、强凸函数实现快于 SGD 的收敛速率?
  • RQ2当遍历次数 $K$ 较小时(例如 $K \lesssim n$),SGDo 的非渐近收敛速率是多少?
  • RQ3在条件数 $\kappa$ 的依赖性方面,SGDo 的性能与 SGD 相比如何?
  • RQ4能否对无放回采样引入的耦合关系进行形式化界控,以支持收敛性分析?
  • RQ5SGDo 是否对一般光滑、强凸函数实现 $O(1/K^2)$ 的收敛速率,与经验观察一致?

主要发现

  • SGDo 对一般光滑、强凸函数实现了 $\widetilde{O}(1/nK^2)$ 的收敛速率,优于 SGD 的 $O(1/nK)$ 速率。
  • 该结果在标准假设下成立——包括光滑性、强凸性和梯度 Lipschitz 性,无需使用先前工作中所需的 Hessian Lipschitz 条件。
  • 当 $K \gtrsim \kappa^2 \log(nK)$ 时,SGDo 的速率优于 SGD,而先前工作需 $K \gtrsim \kappa^{1.5} \sqrt{n}$ 才能达到相同效果。
  • 在小 $K$ 情形下,SGDo 与 SGD 一样达到 $O(1/nK)$ 的速率,这是首次针对一般光滑凸函数获得此类结果(此前仅知在广义线性模型中成立)。
  • 分析结果对条件数 $\kappa$ 的依赖性得到改善,次优性被界为 $O(\kappa^2 G^2 (\log(nK))^2 / (nK^2))$。
  • 通过使用交换对和 Wasserstein 距离,首次实现了对 SGDo 更快收敛的严格分析,即使在梯度存在依赖性的情况下亦成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。