[論文レビュー] Stochastic Gradient Descent with Polyak's Learning Rate
本稿では、最適関数値 $f^*$ の推定を用いて学習率を動的に調整する、ポリアックのステップサイズに基づく適応的学習率を備えた確率的勾配降下法(SGD)を提案する。この手法は、非漸近的収束速度 $\mathcal{O}(1/k)$ を達成し、最適にスケジューリングされた SGD よりも良いレート定数を示す。凸問題および深層ニューラルネットワークにおいて、ハイパーパramータのチューニングなしで実用的な収束性が向上することを示している。
Stochastic gradient descent (SGD) for strongly convex functions converges at the rate $\bO(1/k)$. However, achieving good results in practice requires tuning the parameters (for example the learning rate) of the algorithm. In this paper we propose a generalization of the Polyak step size, used for subgradient methods, to Stochastic gradient descent. We prove a non-asymptotic convergence at the rate $\bO(1/k)$ with a rate constant which can be better than the corresponding rate constant for optimally scheduled SGD. We demonstrate that the method is effective in practice, and on convex optimization problems and on training deep neural networks, and compare to the theoretical rate.
研究の動機と目的
- 最適な収束を得るための SGD における学習率チューニングの課題、特に強い凸性パラメータが未知である場合に焦点を当てる。
- 元来部分勾配法に用いられたポリアックの学習率を、確率的勾配設定に一般化する。
- 最適にスケジュールされた SGD よりも良いレート定数を有する、非漸近的収束速度 $\mathcal{O}(1/k)$ を達成する。
- ハイパーパramータの手動チューニングなしに、凸最適化および深層ニューラルネットワーク学習における手法の実用的有効性を示す。
提案手法
- $f^*$ の推定をランニングベスト値 $f_k^{\text{best}}$ を用いて行い、ポリアックの学習率 $h(x_k) = \frac{f(x_k) - f^*}{\|\partial f(x_k)\|^2}$ を確率的勾配に適応化する。
- 収束を保証するため、$\gamma_k > 0$、$\gamma_k \to 0$、$\sum \gamma_k = \infty$ を満たす適応的学習率 $h_k = \frac{f(x_k) - f_k^{\text{best}} + \gamma_k}{\|\nabla_{mb}f(x_k)\|^2}$ を用いる。
- 実用的な観点から、不正確な $f^*$ の推定による数値的不安定性を避けるために、キャップ付きバージョンを採用する。
- 非漸近的収束バウンド $\mathbb{E}[\|x_k - x^*\|] \leq \frac{C}{k + \gamma}$ を導出する。このバウンドは $k > 0$ のすべての反復で有効である。
- ポリアック SGD のレート定数 $\alpha_P$ を最適にスケジュールされた SGD のレート定数 $\alpha_S$ と比較し、初期条件が有利な場合に $\alpha_P$ が小さくなる可能性を示す。
- 2次計画問題および AllCNN を用いた CIFAR-10 にこの手法を適用。$f^*$ は事前実行からの推定を用いる PyTorch 実装を採用。
実験結果
リサーチクエスチョン
- RQ1ポリアックの学習率は、確率的勾配降下法に一般化可能であり、より良い収束定数を達成できるか?
- RQ2適応的ポリアック SGD 手法は、最適にスケジュールされた SGD よりも良いレート定数を持つ非漸近的 $\mathcal{O}(1/k)$ 収束速度を達成できるか?
- RQ3この手法は、ハイパーパramータチューニングなしに、凸問題および深層学習タスクにおいて実用的に効果的か?
- RQ4$f^*$ が事前学習から推定される場合に、深層学習における手動の学習率チューニングを削減または排除できるか?
主な発見
- ポリアック SGD 手法は、非漸近的収束速度 $\mathcal{O}(1/k)$ を達成し、レート定数 $\alpha_P = \frac{2\mu^2}{\sigma^2 + 2\mu^2(L - \mu)q_0}$ を有する。$q_0 \leq \frac{M^2}{2\mu^2(L - \mu)}$ の条件下では、最適にスケジュールされた SGD のレート定数 $\alpha_S$ よりも小さくなる可能性がある。
- 2次計画問題における数値実験では、40回の平均超過損失において、標準的および最適にスケジュールされた SGD よりもポリアック SGD が優れた性能を示し、理論的バウンドもよりタイトである。
- 最適解に近い初期化がなされた場合、ポリアック SGD は学習率を急速に小さくし、過剰適合を回避するが、固定スケジュールの SGD は良好な初期化を活用できない。
- AllCNN を用いた CIFAR-10 において、ポリアック SGD はハイパーパラメータチューニングなしで、よくチューニングされた SGD スケジュールと同等の訓練損失およびテスト誤差を達成した。
- この手法は、$f^*$ のみがハイパーパラメータとして必要であり、これは事前学習からの推定で可能であるため、繰り返しの訓練に適した実用的設計である。
- 理論的バウンドは非漸近的であり、$k > 0$ のすべての反復で有効である。これは、多くの標準的な収束結果が極限でのみ有効であるのとは対照的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。