Skip to main content
QUICK REVIEW

[論文レビュー] On the Convergence of Step Decay Step-Size for Stochastic Optimization

Xiaoyu Wang, Sindri Magnússon|arXiv (Cornell University)|Feb 18, 2021
Stochastic Gradient Optimization Techniques参考文献 38被引用数 4
ひとこと要約

本稿は、非凸、凸、強く凸な設定において、ステップデイのステップサイズを用いた確率的勾配降下法(SGD)の非漸近的収束保証を初めて確立した。非凸滑らか問題に対しては $Ó(\ln T/\sqrt{T})$ のレートを証明し、一般凸問題では $Ó(\ln T/\sqrt{T})$、滑らかで強く凸な問題では $Ó(\ln T/T)$ を示した。特に、後者の場合にレートのタイトネスを証明した。

ABSTRACT

The convergence of stochastic gradient descent is highly dependent on the step-size, especially on non-convex problems such as neural network training. Step decay step-size schedules (constant and then cut) are widely used in practice because of their excellent convergence and generalization qualities, but their theoretical properties are not yet well understood. We provide the convergence results for step decay in the non-convex regime, ensuring that the gradient norm vanishes at an $\mathcal{O}(\ln T/\sqrt{T})$ rate. We also provide the convergence guarantees for general (possibly non-smooth) convex problems, ensuring an $\mathcal{O}(\ln T/\sqrt{T})$ convergence rate. Finally, in the strongly convex case, we establish an $\mathcal{O}(\ln T/T)$ rate for smooth problems, which we also prove to be tight, and an $\mathcal{O}(\ln^2 T /T)$ rate without the smoothness assumption. We illustrate the practical efficiency of the step decay step-size in several large scale deep neural network training tasks.

研究の動機と目的

  • 深層学習で広く用いられているが、厳密な収束解析が不足しているステップデイのステップサイズの理論的ギャップを埋めること。
  • 非凸、一般凸、強く凸な設定において、ステップデイを用いたSGDの非漸近的収束レートを確立すること。
  • 多項式減衰や指数減衰のステップサイズと比較して、ステップデイがよりタイトな境界を達成できることを示し、既存の収束レートを改善すること。
  • 実践的なステップサイズの減衰パラメータ選択法を体系的かつ妥当性を検証するものとし、大規模な深層学習実験を通じて裏付けたこと。

提案手法

  • 非凸かつ滑らかな設定において、最終反復の選択に非一様サンプリングルール $P_t \propto 1/\eta_t$ を提案することで、収束保証を向上させた。
  • 先行研究が $\alpha = 2$ に限定していたのとは異なり、一般の減衰因子 $\alpha > 1$ を用いたステップデイステップサイズのSGDを分析した。
  • マルティングール差分列と集中不等式を用いて、期待勾配ノルムと最適性ギャップの上限を導出し、収束レートを導出した。
  • 非凸(滑らか)、一般凸(非滑らかを含む)、強く凸(滑らかおよび非滑らか)の3つの問題クラスに分析を適用した。
  • ステップサイズが定数で保たれる区間(フェーズ)を複数設け、所定のマイルストーンで $\alpha$ 倍に減少させるマルチフェーズ分析を採用した。
  • CIFAR-10、CIFAR-100、およびロジスティック回帰の広範な実験を通じて、理論的予測を検証した。ハイパーパrameterとして $\eta_0$、$\alpha$、および減衰マイルストーンをチューニングした。

実験結果

リサーチクエスチョン

  • RQ1ステップデイステップサイズを用いたSGDの非凸設定における非漸近的収束レートは何か?
  • RQ2一般凸問題において、$1/t$ や $1/\sqrt{t}$ のような多項式減衰スケジュールと比較して、ステップデイはより良い収束レートを達成できるか?
  • RQ3強く凸な場合におけるステップデイの最適収束レートは何か? また、そのレートはタイトか?
  • RQ4実際の収束性と一般化性能に与える減衰因子 $\alpha$ の影響は何か?
  • RQ5非一様サンプリングルールは、非凸設定におけるステップデイSGDの収束性を向上させられるか?

主な発見

  • 非凸滑らか問題において、本稿は勾配ノルムの $\mathcal{O}(\ln T/\sqrt{T})$ の収束レートを確立した。これは近似的に最適である。
  • 一般凸問題において、ステップデイ法は最終反復で $\mathcal{O}(\ln T/\sqrt{T})$ の収束レートを達成した。
  • 滑らかで強く凸な場合、収束レートは $\mathcal{O}(\ln T/T)$ であり、本稿ではこのレートがタイトであることを証明した。
  • 非滑らかで強く凸な問題において、収束レートは $\mathcal{O}(\ln^2 T/T)$ であり、これはこの設定におけるステップデイのための最初のこのような境界である。
  • CIFAR-10 および CIFAR-100 における実験結果から、$\alpha = 6$ のステップデイは、定数ステップサイズ、$1/t$、$1/\sqrt{t}$、指数減衰と比較して、より低いテスト損失と高い精度を達成した。
  • 最適な減衰因子 $\alpha = 6$ は、フェーズ長と性能のバランスを取るのに適しており、$\alpha \in [4,6]$ が $\alpha \in [7,12]$ よりも優れた一般化性能と安定性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。