Skip to main content
QUICK REVIEW

[論文レビュー] How Good is SGD with Random Shuffling?

Itay Safran, Ohad Shamir|arXiv (Cornell University)|Jul 31, 2019
Stochastic Gradient Optimization Techniques参考文献 15被引用数 5
ひとこと要約

本稿は、有限和、滑らかで強く凸な問題における確率的勾配降下法(SGD)のランダムシャッフルについて、最適化誤差のタイトな下界を初めて提示する。繰り返しランダムリシェッティングが、単一シャッフル($\Omega(1/(nk^2))$)と比較してより速い収束速度$\Omega(1/(nk)^2 + 1/(nk^3))$を達成することを証明し、定数ステップサイズ下での二つの戦略間の本質的性能差を確立する。

ABSTRACT

We study the performance of stochastic gradient descent (SGD) on smooth and strongly-convex finite-sum optimization problems. In contrast to the majority of existing theoretical works, which assume that individual functions are sampled with replacement, we focus here on popular but poorly-understood heuristics, which involve going over random permutations of the individual functions. This setting has been investigated in several recent works, but the optimal error rates remain unclear. In this paper, we provide lower bounds on the expected optimization error with these heuristics (using SGD with any constant step size), which elucidate their advantages and disadvantages. In particular, we prove that after $k$ passes over $n$ individual functions, if the functions are re-shuffled after every pass, the best possible optimization error for SGD is at least $Ω\left(1/(nk)^2+1/nk^3 ight)$, which partially corresponds to recently derived upper bounds. Moreover, if the functions are only shuffled once, then the lower bound increases to $Ω(1/nk^2)$. Since there are strictly smaller upper bounds for repeated reshuffling, this proves an inherent performance gap between SGD with single shuffling and repeated shuffling. As a more minor contribution, we also provide a non-asymptotic $Ω(1/k^2)$ lower bound (independent of $n$) for the incremental gradient method, when no random shuffling takes place. Finally, we provide an indication that our lower bounds are tight, by proving matching upper bounds for univariate quadratic functions.

研究の動機と目的

  • 有限和最適化におけるランダムシャッフル付きSGDの理論的性能限界を理解すること。
  • 繰り返しランダムリシェッティングが単一シャッフルや固定順序インクリメンタル手法よりも明示的な利点を示すかどうかという未解決問題を解消すること。
  • 異なるシャッフル戦略下での定数ステップサイズSGDの最適化誤差に対するタイトな下界を確立すること。
  • 一変数二次関数に対して既存の上界が最適であることを示すために、一致する下界を証明すること。

提案手法

  • 繰り返しランダムリシェッティング、単一シャッフル、およびインクリメンタル勾配法のSGDにおける期待最適化誤差の下界を導出する。
  • 既知の上界と一致するタイトな下界を構築するため、一変数二次関数モデルを用いる。
  • 収縮係数の積をバウンドするために、集中不等式およびAM-GM不等式を適用する。
  • 再帰的期待値バウンドを用いて$k$回のパス全体にわたる誤差伝播を分析し、リシェッティングされた反復間の独立性を活用する。
  • ランダムシャッフルなしのインクリメンタル勾配法に対して、非漸近的$\Omega(1/k^2)$の下界を確立する。
  • 解析における収束項と誤差項のバランスを取るために、ステップサイズ$\eta = \frac{\log(n^{0.5}k)}{\lambda n k}$を用いる。

実験結果

リサーチクエスチョン

  • RQ1滑らかで強く凸な有限和問題における繰り返しランダムリシェッティング付きSGDの最適到達誤差率は何か?
  • RQ2繰り返しランダムリシェッティングは、単一シャッフルや固定順序インクリメンタル手法よりも明示的な利点を提供するか?
  • RQ3異なるシャッフル方式下での定数ステップサイズSGDの最適化誤差に対する根本的下界は何か?
  • RQ4繰り返しリシェッティングの既存上界はタイトであるか、それらを改善できるか?
  • RQ5ランダムシャッフルが欠如している場合、インクリメンタル勾配法の収束速度にどのような影響があるか?

主な発見

  • 繰り返しランダムリシェッティング付きSGDの期待最適化誤差は、少なくとも$\Omega(1/(nk)^2 + 1/(nk^3))$であり、既知の上界と一致する。
  • 単一シャッフルの場合、下界は$\Omega(1/(nk^2))$であり、繰り返しリシェッティングの場合より厳しくなる。
  • これにより、繰り返しリシェッティングと単一シャッフルの間には本質的性能差が存在し、繰り返しリシェッティングが理論的に優れていることが証明される。
  • インクリメンタル勾配法(ランダムシャッフルなし)に対して、$n$に依存しない非漸近的$\Omega(1/k^2)$の下界が確立される。
  • 一変数二次関数において、下界は上界と一致しており、解析のタイトさが示される。
  • 解析により、繰り返しリシェッティング下での最良の誤差率が$\tilde{\mathcal{O}}(1/(nk)^2 + 1/(nk^3))$を上回ることはなく、このバウンドがタイトであることが確認される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。