Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting the Polyak step size

Elad Hazan, Sham M. Kakade|arXiv (Cornell University)|May 1, 2019
Stochastic Gradient Optimization Techniques参考文献 5被引用数 10
ひとこと要約

この論文は勾配降下法におけるPolyakステップサイズを再考し、滑らかさ、強凸性、リプシッツ定数の事前知識がなくても、非滑らか、滑らか、強凸、良好に条件付けられたすべての標準的凸最適化設定において近似的に最適な収束レートを達成する単純な変種を証明している。この手法は、劣性ギャップと勾配ノルムを用いてステップサイズを自己調整し、パラメータフリーで最適な収束レートを達成する。

ABSTRACT

This paper revisits the Polyak step size schedule for convex optimization problems, proving that a simple variant of it simultaneously attains near optimal convergence rates for the gradient descent algorithm, for all ranges of strong convexity, smoothness, and Lipschitz parameters, without a-priory knowledge of these parameters.

研究の動機と目的

  • 一階凸最適化における、滑らかさや強凸性、リプシッツ定数のパラメータを事前に知らないまま、あらゆる問題設定で最適な収束レートを同時に達成できる、パラメータフリーで自己調整可能なステップサイズスケジュールの欠如に対処すること。
  • 滑らかさ、強凸性、リプシッツ定数のレベルが異なる状況に、1つのステップサイズルールがそれらのパrameterの事前知識なしに適応可能かどうかを調査すること。
  • 従来、非滑らかな凸問題に対してのみ最適とされていたPolyakステップサイズが、すべての標準的凸最適化設定で最適な収束レートを達成できるように拡張可能かどうかを示すこと。
  • 最適値の下界を動的に修正し、それを用いてステップサイズを計算する自己調整アルゴリズムを設計し、調整なしに収束を保証すること。
  • 提案手法が、非滑らか、滑らか、強凸、良好に条件付けられた問題の各レジームで、既知の最良の収束レートと一致することを理論的に保証すること。

提案手法

  • Polyakステップサイズの変種を提案:$\eta_t = \frac{f(\mathbf{x}_t) - f(\mathbf{x}^\star)}{\|\nabla_t\|^2}$。劣性ギャップと勾配ノルムを用いてステップサイズを自己調整する。
  • 最適値 $f(\mathbf{x}^\star)$ の下界 $\tilde{f}$ を維持する自己調整アルゴリズム(アルゴリズム3)を導入し、現在の反復点が所望の精度を満たさない場合に二分探索を用いて更新する。
  • 収束解析の根幹となる再帰関係として、$d_{t+1}^2 \leq d_t^2 - 2\eta_t h_t + \eta_t^2 \|\nabla_t\|^2$(補題1)を用いる。これは最適解からの距離の二乗の減少を表す。
  • 最適解からの距離の二乗 $d_t^2$ の減少を劣性ギャップ $h_t$ と比較することで収束バウンドを確立し、強凸性と滑らかさの性質を活用して $h_t$ と $\|\nabla_t\|^2$ の関係を導出する。
  • 下界 $\tilde{f}$ の再帰的改善を適用し、各反復で、劣性ギャップが $\leq R_{T,1/2}$ 以下の点を返すか、真の最適値からのギャップを半分にする。
  • アルゴリズムが、4つの既知の最適レートの最小値である $O(1/\sqrt{T})$、$O(\beta/T)$、$O(1/(\alpha T))$、$O(e^{-\beta/\alpha \cdot T})$ を、問題のレジームに応じて達成することを証明する。

実験結果

リサーチクエスチョン

  • RQ11つのパラメータフリーなステップサイズスケジュールが、非滑らか、滑らか、強凸、良好に条件付けられたすべての標準的凸最適化レジームで、滑らかさや強凸性のパラメータを事前に知らないまま、最適な収束レートを達成可能か?
  • RQ2元々非滑らかな凸問題に提案されたPolyakステップサイズが、滑らかで強凸な設定でも最適な収束レートを達成できるか?
  • RQ3最適値を動的に推定し、それを用いてステップサイズを計算する自己調整アルゴリズムを設計でき、調整なしに最適な収束レートを達成できるか?
  • RQ4滑らかさ、強凸性、リプシッツ定数の定数を知らない状況下で、Polyakステップサイズを用いた勾配降下法の収束に対して、どのような理論的保証を示せるか?
  • RQ5アルゴリズム3における自己調整下界の改善戦略が、各レジームで既知の最良の速度で最適解に収束することをどのように保証するか?

主な発見

  • 提案されたPolyakステップサイズの変種は、非滑らか、滑らか、強凸、良好に条件付けられたすべての標準的凸最適化レジームで、$\alpha$, $\beta$, $G$ の事前知識がなくても、既知の最良の収束レートを達成する。
  • 非滑らかな凸問題では、$O(1/\sqrt{T})$ の収束を達成し、投影勾配降下法の最適レートと一致する。
  • $\beta$-滑らかな問題では、$O(\beta/T)$ の収束を達成し、既知の最適レートと一致する。
  • $\alpha$-強凸な問題では、$O(1/(\alpha T))$ の収束を達成し、勾配降下法にとって最適なレートである。
  • $\alpha$-強凸かつ $\beta$-滑らかな問題では、指数的 $O(e^{-\beta/\alpha \cdot T})$ の収束を達成し、既知の最良のレートと一致する。
  • 自己調整アルゴリズム(アルゴリズム3)は、$K = \lceil 2\log(f(\mathbf{x}^\star) - \tilde{f}_0)/B_T \rceil$ 回の反復後、最終反復点が $f(\bar{\mathbf{x}}) - f(\mathbf{x}^\star) \leq f(\mathbf{x}^\star) + B_T$ を満たすことを保証する。ここで $B_T$ は4つの最適レートの最小値である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。