Skip to main content
QUICK REVIEW

[論文レビュー] Closing the convergence gap of SGD without replacement

Shashank Rajput, Anant Gupta|arXiv (Cornell University)|Feb 24, 2020
Stochastic Gradient Optimization Techniques被引用数 10
ひとこと要約

この論文は、強い凸性を満たす二次関数に対して、確率的勾配降下法の置換なし(SGDo)の理論的収束ギャップを閉じ、収束速度の最適レート $ olimits\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$ を証明することで、既知の最良下界と一致する。また、一般の滑らかな強い凸関数に対して、$ olimits\Omega\left(\frac{n}{T^2}\right)$ の新しい下界を確立し、SGDoの収束理論における長年の不確実性を解消した。

ABSTRACT

Stochastic gradient descent without replacement sampling is widely used in practice for model training. However, the vast majority of SGD analyses assumes data is sampled with replacement, and when the function minimized is strongly convex, an $\mathcal{O}\left(\frac{1}{T} ight)$ rate can be established when SGD is run for $T$ iterations. A recent line of breakthrough works on SGD without replacement (SGDo) established an $\mathcal{O}\left(\frac{n}{T^2} ight)$ convergence rate when the function minimized is strongly convex and is a sum of $n$ smooth functions, and an $\mathcal{O}\left(\frac{1}{T^2}+\frac{n^3}{T^3} ight)$ rate for sums of quadratics. On the other hand, the tightest known lower bound postulates an $Ω\left(\frac{1}{T^2}+\frac{n^2}{T^3} ight)$ rate, leaving open the possibility of better SGDo convergence rates in the general case. In this paper, we close this gap and show that SGD without replacement achieves a rate of $\mathcal{O}\left(\frac{1}{T^2}+\frac{n^2}{T^3} ight)$ when the sum of the functions is a quadratic, and offer a new lower bound of $Ω\left(\frac{n}{T^2} ight)$ for strongly convex functions that are sums of smooth functions.

研究の動機と目的

  • 強い凸性を満たす設定において、SGDの置換なし(SGDo)の上界と下界の理論的収束ギャップを閉じること。
  • 目的関数が二次関数の和または滑らかな関数である場合の、SGDoの収束速度に対するタイトな上界と下界を確立すること。
  • 既存のSGDoの上界が緩いや情報理論的に最適であるかどうかという未解決の問いを解消すること。
  • 滑らかな成分の和で表される強い凸関数に対して、$ olimits\Omega\left(\frac{n}{T^2}\right)$ の新しい下界を提供すること。

提案手法

  • 標準的な仮定(強い凸性、滑らかさ、有界な勾配)の下でSGDoの収束を分析する。
  • 集中法とマルティングルの議論を用いて、二次的目的関数に対して上界 $ olimits\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$ を導出する。
  • 先行研究の1次元関数に基づく新しい下界インスタンスを構築し、2次元に拡張することで最悪ケースの挙動を示す。
  • 各座標がSGDoにおいて独立に進化する2次元構成を用い、次元ごとの収束を別々に分析可能にする。
  • 条件付き期待値と尾確率のバウンドを適用して反復値の逸脱を制御し、誤差の下界を導出する。
  • 先行研究(例:HaoChen & Sra, Nagarajら)の結果と新しい技術的補題を組み合わせ、バウンドをタイトにする。

実験結果

リサーチクエスチョン

  • RQ1SGDoが二次関数に対して得られた $\tilde{\mathcal{O}}\left(\frac{1}{T^2} + \frac{n^3}{T^3}\right)$ の上界はタイトか、それとも改善可能か?
  • RQ2滑らかな成分の和で表される強い凸関数に対するSGDoの情報理論的に最適な収束速度は何か?
  • RQ3一般の滑らかな強い凸関数の場合に、SGDoの上界と一致する下界を確立できるか?
  • RQ4SGDoがSGDの置換ありよりも経験的に優れているのは、収束速度の観点から理論的に裏付けられているか?

主な発見

  • 目的関数が二次関数の和である場合のSGDoに対して、タイトな上界 $ olimits\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$ を確立し、既知の下界とギャップを埋めた。
  • 滑らかな成分の和で表される強い凸関数に対して、$ olimits\Omega\left(\frac{n}{T^2}\right)$ の新しい下界を証明し、このクラスにおける最良の既知の上界と一致した。
  • 二次関数に対する上界は、従来の最良状態 $\tilde{\mathcal{O}}\left(\frac{1}{T^2} + \frac{n^3}{T^3}\right)$ よりも $n^3$ 項を $n^2$ に削減することで改善された。
  • 結果は、SGDoが二次関数および一般の滑らかな強い凸関数の両設定において、情報理論的に最適な収束速度を達成していることを示している。
  • 分析により、SGDoがSGDの置換ありよりも経験的に優れている性能優位性が、収束速度の観点から理論的に正当化されていることが確認された。
  • 下界の証明における構成は、先行研究の1次元関数の2次元拡張に基づいており、少なくとも1つの座標が誤差 $\Omega\left(\frac{G^2 n}{T^2}\right)$ を被る必要があることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。