Skip to main content
QUICK REVIEW

[論文レビュー] Almost sure convergence rates for Stochastic Gradient Descent and Stochastic Heavy Ball

Othmane Sebbouh, Robert M. Gower|arXiv (Cornell University)|Jun 14, 2020
Stochastic Gradient Optimization Techniques参考文献 34被引用数 7
ひとこと要約

本稿は、一般の確率的近似設定における確率的勾配降下法(SGD)および確率的ヘヴィボール法(SHB)の、初めてのほとんど確実な収束速度を確立する。凸かつ滑らかな設定下で、SGDの反復値の重み付き平均が、ほとんど確実に $o(1/ar{\sqrt{k}})$ に近い速度で収束することを証明する。過パラメータ化された状況では、$o(1/k)$ に改善され、SHBに対しても同様の速度が得られる。結果は、ラインサーチやポリャクステップサイズといった適応的ステップサイズに対しても拡張可能であり、勾配ノルムの非凸収束速度も含む。

ABSTRACT

We study stochastic gradient descent (SGD) and the stochastic heavy ball method (SHB, otherwise known as the momentum method) for the general stochastic approximation problem. For SGD, in the convex and smooth setting, we provide the first \emph{almost sure} asymptotic convergence \emph{rates} for a weighted average of the iterates . More precisely, we show that the convergence rate of the function values is arbitrarily close to $o(1/\sqrt{k})$, and is exactly $o(1/k)$ in the so-called overparametrized case. We show that these results still hold when using stochastic line search and stochastic Polyak stepsizes, thereby giving the first proof of convergence of these methods in the non-overparametrized regime. Using a substantially different analysis, we show that these rates hold for SHB as well, but at the last iterate. This distinction is important because it is the last iterate of SGD and SHB which is used in practice. We also show that the last iterate of SHB converges to a minimizer \emph{almost surely}. Additionally, we prove that the function values of the deterministic HB converge at a $o(1/k)$ rate, which is faster than the previously known $O(1/k)$. Finally, in the nonconvex setting, we prove similar rates on the lowest gradient norm along the trajectory of SGD.

研究の動機と目的

  • 機械学習および最適化において中心的な役割を果たす確率的近似問題におけるSGDおよびSHBの、ほとんど確実な収束速度を確立すること。
  • SGDおよびSHBの収束が期待値の収束のみに限られるという文献のギャップを埋め、ほとんど確実な収束速度を提供すること。
  • 非過パラメータ化された状況下でも、確率的ラインサーチや確率的ポリャクステップサイズといった適応的ステップサイズ戦略への収束保証を拡張すること。
  • 実用的導入に不可欠であるSHBの最終反復が、ほとんど確実に最小値点に収束することを示すこと。
  • 決定的ヘヴィボール法の収束速度を高速化し、従来の $O(1/k)$ ではなく $o(1/k)$ を証明すること。

提案手法

  • ほとんど確実な収束を解析するため、SGD反復値の新しい重み付き平均を導入し、Robbins-Siegmundの超マルティンゲール定理を活用する。
  • 古典的なRobbins-Monro条件を越える、収束速度を保証する新しいステップサイズ条件(条件1)を構築する。
  • SHBの解析にリャプノフ関数アプローチを適用し、状態ベクトル $z_k = x_k + \lambda_k(x_k - x_{k-1})$ を用いて収束を追跡する。
  • 条件付き期待値および凸性・滑らかさの仮定を用いて、最小値点までの距離および目的関数ギャップの期待減少をバウンディングする。
  • 積分バウンディングおよび漸近的解析を用いて収束速度を導出し、特に $\eta_k \propto 1/\sqrt{k}$ のような調和的ステップサイズ列に対して有効である。
  • ABC条件の下で非凸設定への拡張を行い、最小勾配ノルムのほとんど確実な収束速度が $o(1/\sqrt{k})$ であることを証明する。

実験結果

リサーチクエスチョン

  • RQ1凸かつ滑らかな確率的近似設定下で、SGDのほとんど確実な収束速度は何か?
  • RQ2過パラメータ化された状況($\nabla f_v(x_*) = 0$)では、SGDの収束速度を $o(1/k)$ に改善できるか?
  • RQ3確率的ラインサーチや確率的ポリャクステップサイズといった適応的ステップサイズ法は、ほとんど確実に収束するか? その速度は何か?
  • RQ4実用的に用いられるSHBの最終反復に対しても、同様のほとんど確実な収束速度を確立できるか?
  • RQ5決定的ヘヴィボール法のほとんど確実な収束速度は何か? かつ、従来の $O(1/k)$ よりも改善されるか?

主な発見

  • SGDでは、反復値の重み付き平均における関数値が、凸かつ滑らかな設定下で、ほとんど確実に $o(1/\sqrt{k})$ に近い速度で収束する。
  • 過パラメータ化された状況では、確率的勾配が最小値点で消えるため、収束速度が $o(1/k)$ に向上する。
  • 確率的ラインサーチおよび確率的ポリャクステップサイズに対しても結果が成り立ち、非過パラメータ化された状況下で初めて、ほとんど確実な収束を証明する。
  • SHBでは、最終反復がほとんど確実に最小値点に収束し、関数値の収束速度も $o(1/\sqrt{k})$ に近い。
  • 過パラメータ化された状況では、SHBの最終反復は $o(1/k)$ の収束速度を達成し、SGDの最良-knownレートと一致する。
  • 決定的ヘヴィボール法は $o(1/k)$ の速度で収束し、従来の $O(1/k)$ のレートを改善する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。