Skip to main content
QUICK REVIEW

[論文レビュー] SGD for Structured Nonconvex Functions: Learning Rates, Minibatching and Interpolation

Robert M. Gower, Othmane Sebbouh|arXiv (Cornell University)|Jun 18, 2020
Stochastic Gradient Optimization Techniques参考文献 50被引用数 6
ひとこと要約

この論文は、従来の成長条件や滑らかさ条件よりも弱い仮定である期待残差(ER)条件を導入することで、構造的非凸関数における確率的勾配降下法(SGD)の収束保証を新たに確立した。ER条​​件の下で、準凸関数に対しては非線形収束を、Polyak-Lojasiewicz(PL)関数に対しては線形収束を証明し、最小バッチサイズと補間設定における最先端の収束速度を達成した。

ABSTRACT

Stochastic Gradient Descent (SGD) is being used routinely for optimizing non-convex functions. Yet, the standard convergence theory for SGD in the smooth non-convex setting gives a slow sublinear convergence to a stationary point. In this work, we provide several convergence theorems for SGD showing convergence to a global minimum for non-convex problems satisfying some extra structural assumptions. In particular, we focus on two large classes of structured non-convex functions: (i) Quasar (Strongly) Convex functions (a generalization of convex functions) and (ii) functions satisfying the Polyak-Lojasiewicz condition (a generalization of strongly-convex functions). Our analysis relies on an Expected Residual condition which we show is a strictly weaker assumption than previously used growth conditions, expected smoothness or bounded variance assumptions. We provide theoretical guarantees for the convergence of SGD for different step-size selections including constant, decreasing and the recently proposed stochastic Polyak step-size. In addition, all of our analysis holds for the arbitrary sampling paradigm, and as such, we give insights into the complexity of minibatching and determine an optimal minibatch size. Finally, we show that for models that interpolate the training data, we can dispense of our Expected Residual condition and give state-of-the-art results in this setting.

研究の動機と目的

  • 非凸最適化における標準的SGD収束理論(遅い非線形収束)と実験的性能(高速なグローバル収束)のギャップを解消する。
  • 有界分散や成長条件よりも弱い仮定を導入することで、構造的非凸関数におけるSGDの収束保証をより厳密に与える。
  • 定数、減少、確率的ポリャクステップサイズといったさまざまなステップサイズルールと、任意のサンプリングフレームワークを用いたSGDの分析を行う。
  • ミニバッチSGDの最適バッチサイズと複雑度バウンズを特定する。
  • 補間を行うモデルに対して、ER条件を必要としない最先端の収束結果を確立する。

提案手法

  • 強い成長条件や期待滑らかさといった既存の条件よりも、統一的かつ厳密に弱い仮定である期待残差(ER)条件を導入する。
  • ER条件の下で、2つの関数クラス(準凸関数とPL正則化関数)に対してSGDがグローバル最小値に収束することを証明する。
  • ER条件を用いて、定数、減少、確率的ポリャクステップサイズの各場合の収束速度を導出する。
  • 任意のサンプリングフレームワークを用いて、ミニバッチ固有のERおよび滑らかさパラメータの定数を導出する。
  • 補間モデルではER条件が不要であり、PL条件のみで線形収束が達成可能であることを確立する。
  • 任意のサンプリングフレームワークを用いて、準凸関数およびPL関数の両方に対して反復複雑度バウンズと最適バッチサイズを導出する。

実験結果

リサーチクエスチョン

  • RQ1有界分散や成長条件よりも弱い仮定の下で、SGDは構造的非凸関数に対してグローバル収束を達成できるか?
  • RQ2強い成長条件や期待滑らかさといった既存の仮定と比較して、期待残差(ER)条件は一般性とタイトネスの観点でどのように異なるか?
  • RQ3準凸関数およびPL関数に対して、ER条件の下でのSGDの最適バッチサイズと反復複雑度は何か?
  • RQ4補間領域(例:過剰パラメータ化モデル)ではER条件を排除できるか?この場合に達成可能な収束速度は何か?
  • RQ5定数、減少、確率的ポリャクステップサイズといった異なるステップサイズルールは、ER条件下での収束にどのように影響するか?

主な発見

  • 準凸関数に対しては、ER条件の下でSGDが $\mathcal{O}(1/\sqrt{k})$ の速度で収束し、既存の最先端の結果と同等またはそれを上回る。
  • PL関数に対しては、有界分散や成長仮定を必要とせず、ER条件のみに依存して近傍への線形収束が達成される。
  • ER条件は強い成長条件、弱い成長条件、期待滑らかさよりも厳密に弱く、補間や $x^*$-凸関数を含むより広い非凸関数のクラスに成立する。
  • ミニバッチSGDでは、問題パラメータの関数として最適バッチサイズが導出され、反復複雑度が最小化される。
  • 補間領域(例:過剰パラメータ化モデル)ではER条件は不要であり、PL条件のみで線形収束が直接証明可能である。
  • ER条件の下での勾配降下法の理論的反復複雑度は、既知の結果と比較して非最適であることが示され、SGD解析においてER条件の必要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。