[論文レビュー] SGD without Replacement: Sharper Rates for General Smooth Convex Functions
本稿は、一般の滑らかで強く凸な関数に対して、確率的勾配降下法の「繰り返しなし」(SGDo)の非漸近的収束解析を初めて提供する。交換可能な対を用いて Wasserstein 距離を評価し、標準的な滑らかさと強く凸性の仮定のもとで、ヘッセ行列のリプシッツ連続性を仮定しない条件下で、収束速度 $ abla{O}(1/nK^2)$ を確立する。これは SGD の $O(1/nK)$ よりも鋭い結果である。
We study stochastic gradient descent {\em without replacement} (\sgdwor) for smooth convex functions. \sgdwor is widely observed to converge faster than true \sgd where each sample is drawn independently {\em with replacement} \cite{bottou2009curiously} and hence, is more popular in practice. But it's convergence properties are not well understood as sampling without replacement leads to coupling between iterates and gradients. By using method of exchangeable pairs to bound Wasserstein distance, we provide the first non-asymptotic results for \sgdwor when applied to {\em general smooth, strongly-convex} functions. In particular, we show that \sgdwor converges at a rate of $O(1/K^2)$ while \sgd is known to converge at $O(1/K)$ rate, where $K$ denotes the number of passes over data and is required to be {\em large enough}. Existing results for \sgdwor in this setting require additional {\em Hessian Lipschitz assumption} \cite{gurbuzbalaban2015random,haochen2018random}. For {\em small} $K$, we show \sgdwor can achieve same convergence rate as \sgd for {\em general smooth strongly-convex} functions. Existing results in this setting require $K=1$ and hold only for generalized linear models \cite{shamir2016without}. In addition, by careful analysis of the coupling, for both large and small $K$, we obtain better dependence on problem dependent parameters like condition number.
研究の動機と目的
- 実用的な SGD の「繰り返しなし」(SGDo)と、理論的 SGD の「繰り返しあり」の間にある理論的ギャップを解消すること。後者は既知の通り収束が遅い。
- 滑らかさ、強く凸性、勾配のリプシッツ連続性という標準的仮定の下で、SGDo のよりタイトな非漸近的収束速度を確立すること。
- 従来の研究が追加のヘッセ行列のリプシッツ連続性条件を必要としたり、一般線形モデルや $K=1$ に限定されたりしていたのを改善すること。
- 大規模および小規模な $K$ の両方の状況を分析し、繰り返し回数に応じて SGDo が SGD の収束速度を一致または上回ることを示すこと。
- サンプリングの「繰り返しなし」によって生じる依存性を扱うために、最適輸送(交換可能な対)を用いたカップリング技法を開発すること。
提案手法
- 交換可能な対の手法を用いて、SGDo の反復点と SGD の反復点の間の Wasserstein 距離を評価し、収束行動の比較を可能にする。
- 収束速度の向上と分散の低減を目的に、最後の $K/2$ 回のパスにわたる suffix 平均化スキームを適用する。
- 強く凸性と滑らかさの性質を用いて、最適解からの二乗距離 $ abla{E}[\|x_k - x^*\|^2]$ に対する再帰的バインドを導出する。
- バイアスとバイアスのバランスを取るために、ステップサイズを $ abla{\alpha} = \Theta(\log(nK)/(\mu nK))$ と設定する。
- 「繰り返しなし」のサンプリングによって生じる勾配と反復点の間のカップリングを分析し、標準的な SGD に存在しない依存性を扱う。
- 凸性と勾配のリプシッツ連続性を用いて、問題依存パラメータ(例:条件数 $ abla{\kappa}$)を含む、サブオプティマルさ $ abla{E}[F(x) - F(x^*)]$ のバインドを導出する。
実験結果
リサーチクエスチョン
- RQ1ヘッセ行列のリプシッツ連続性を仮定しない一般の滑らかで強く凸な関数に対して、SGDo は SGD よりも速い収束速度を達成できるか?
- RQ2繰り返し回数 $K$ が小さい場合(例:$K \lesssim n$)に、SGDo の非漸近的収束速度は何か?
- RQ3条件数 $ abla{\kappa}$ に依存する点で、SGDo の性能は SGD と比べてどうなるか?
- RQ4「繰り返しなし」のサンプリングによって生じるカップリングを形式的にバインドできるか?
- RQ5一般の滑らかで強く凸な関数に対して、SGDo は $O(1/K^2)$ の収束速度を達成できるか?これは実験的観察と一致する。
主な発見
- 一般の滑らかで強く凸な関数に対して、SGDo は収束速度 $ abla{O}(1/nK^2)$ を達成する。これは SGD の $O(1/nK)$ よりも速い。
- この結果は、ヘッセ行列のリプシッツ連続性を仮定しない標準的仮定(滑らかさ、強く凸性、勾配のリプシッツ連続性)のもとで成立する。
- $K \gtrsim \kappa^2 \log(nK)$ の場合、SGDo の収束速度は SGD を上回る。一方、従来の研究では $K \gtrsim \kappa^{1.5} \sqrt{n}$ が必要であった。
- 小規模な $K$ の場合、SGDo は SGD と同様に $O(1/nK)$ の収束速度を達成する。これは、一般の滑らかで凸関数に対して初めての結果であり、従来は一般線形モデルに限られていた。
- 条件数 $ abla{\kappa}$ への依存性が改善され、サブオプティマルさが $O(\kappa^2 G^2 (\log(nK))^2 / (nK^2))$ でバインドされる。
- 交換可能な対と Wasserstein 距離の使用により、依存する勾配が存在する中で SGDo の高速収束を初めて厳密に解析可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。