Skip to main content
QUICK REVIEW

[論文レビュー] A Second look at Exponential and Cosine Step Sizes: Simplicity, Adaptivity, and Performance

Xiaoyu Li, Zhenxun Zhuang|OpenBU (Boston University)|Feb 12, 2020
Stochastic Gradient Optimization Techniques参考文献 81被引用数 12
ひとこと要約

本稿は、滑らかな非凸関数に対する確率的勾配降下法(SGD)における指数関数的およびコサインスケジュールの最初の理論的収束保証を提供する。これらは近似的に最適なレートを達成し、Polyak-Łojasiewicz(PL)条件の下で勾配ノイズのレベルに驚くべきほど適応的であることが証明されている。実験的に、これらの単純なスケジュールはAdam や段階的減衰といった最先端の手法と同等またはそれを上回る性能を示し、調整が必要なハイパーパrameterは1つまたは2つだけである。

ABSTRACT

Stochastic Gradient Descent (SGD) is a popular tool in training large-scale machine learning models. Its performance, however, is highly variable, depending crucially on the choice of the step sizes. Accordingly, a variety of strategies for tuning the step sizes have been proposed, ranging from coordinate-wise approaches (a.k.a. ``adaptive'' step sizes) to sophisticated heuristics to change the step size in each iteration. In this paper, we study two step size schedules whose power has been repeatedly confirmed in practice: the exponential and the cosine step sizes. For the first time, we provide theoretical support for them proving convergence rates for smooth non-convex functions, with and without the Polyak-Łojasiewicz (PL) condition. Moreover, we show the surprising property that these two strategies are \emph{adaptive} to the noise level in the stochastic gradients of PL functions. That is, contrary to polynomial step sizes, they achieve almost optimal performance without needing to know the noise level nor tuning their hyperparameters based on it. Finally, we conduct a fair and comprehensive empirical evaluation of real-world datasets with deep learning architectures. Results show that, even if only requiring at most two hyperparameters to tune, these two strategies best or match the performance of various finely-tuned state-of-the-art strategies.

研究の動機と目的

  • SGDにおける指数関数的およびコサインスケジュールの経験的成功の理論的裏付けを提供すること。
  • これらの単純なスケジュールが、勾配ノイズのレベルなどの問題固有の特性に適応するかどうかを調査すること。
  • 実世界のディープラーニングタスクにおいて、最先端の適応的およびヒューリスティックなステップサイズ戦略と比較して、それらの性能を評価すること。
  • 最小限のハイパーパrameterチューニングでも、複雑で細かく調整されたベースラインと同等またはそれを上回る性能を達成できることを示すこと。

提案手法

  • 滑らかさとPL条件の仮定の下で、指数関数的およびコサインスケジュールを用いたSGDの理論的分析。
  • 非凸関数に対する収束レートの導出。対数要因を除き、O(1/√t) の収束が示される。
  • PL条件の下で、ノイズのレベルを事前に知らなくても、かつそれに基づくチューニングが不要な状況でも、両スケジュールが勾配ノイズのレベルに適応することの証明。
  • CIFAR-10 および ImageNet における実験評価。Adam、多項式減衰、段階的スケジュールと比較。
  • 各手法間の比較を可能にするために、固定されたハイパーパramーターサーチ予算を用いた公平なベンチマークの構築。
  • 訓練損失およびテスト損失曲線の分析により、早期のステップサイズ減衰の影響を検討。過学習のリスクを可視化。

実験結果

リサーチクエスチョン

  • RQ1指数関数的およびコサインスケジュールは、滑らかな非凸関数に対して、証明可能な最適な収束レートを達成するか?
  • RQ2これらのスケジュールは、ノイズのレベルを明示的に知らなくても、またはそれに基づくチューニングがなくても、確率的勾配のノイズレベルに適応できるか?
  • RQ3これらの単純なスケジュールは、ディープラーニングにおける最先端の適応的およびヒューリスティックな学習率戦略と比較して、実験的にどのように性能を発揮するか?
  • RQ4早期の学習率減衰が一般化性能に与える影響は何か? そして、これらのスケジュールはそのようなリスクをどのように軽減するか?

主な発見

  • 指数関数的およびコサインスケジュールは、滑らかな非凸関数に対して、O(1/√t) の収束レートを達成し、対数要因を除き、既知の最良の理論的レートと一致する。
  • Polyak-Łojasiewicz(PL)条件の下で、両スケジュールは勾配ノイズのレベルに適応し、ノイズレベルの知識やそれに基づくチューニングが不要な状況でも、近似的に最適な性能を達成する。
  • CIFAR-10 および ImageNet において、コサインおよび指数スケジュールはAdam、多項式減衰、段階的スケジュールを上回るか同等の性能を示し、ImageNetではコサインスケジュールが最高のテスト精度 0.7497±0.0044 を達成した。
  • CIFAR-10 では、指数スケジュールが訓練損失(0.0006±0.0001)およびテスト損失(0.0098±0.0010)の最低値を記録し、すべてのベースラインを上回った。
  • 実験結果から、コサインおよび指数スケジュールはそれぞれ1つまたは2つのハイパーパラメータしか必要としない一方で、複数のマイルストーンを必要とする段階的減衰のような手法(3〜4つのハイパーパラメータを要する)を上回る性能を発揮することが分かった。
  • 可視化結果から、早期の学習率減衰は過学習を引き起こし、テスト損失を上昇させることを示しており、コサインおよび指数スケジュールがそのような罠を回避する強靭性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。