[論文レビュー] REX: Revisiting Budgeted Training with an Improved Schedule
本稿では、反転指数関数的プロファイルと反復的サンプリングを組み合わせた、従来のスケジュールを凌駕する新しい学習率スケジュールであるREXを提案する。REXは、低予算および高予算のトレーニング環境において、追加のハイパーパramータ、計算コスト、ストレージを必要とせず、画像分類、物体検出、NLPタスクで最先端の性能を達成する。SGDおよびAdam最適化手法を用いた82の実験設定において、線形、ステップ、コサイン、OneCycleスケジュールを常に上回る性能を示した。
Deep learning practitioners often operate on a computational and monetary budget. Thus, it is critical to design optimization algorithms that perform well under any budget. The linear learning rate schedule is considered the best budget-aware schedule, as it outperforms most other schedules in the low budget regime. On the other hand, learning rate schedules -- such as the exttt{30-60-90} step schedule -- are known to achieve high performance when the model can be trained for many epochs. Yet, it is often not known a priori whether one's budget will be large or small; thus, the optimal choice of learning rate schedule is made on a case-by-case basis. In this paper, we frame the learning rate schedule selection problem as a combination of $i)$ selecting a profile (i.e., the continuous function that models the learning rate schedule), and $ii)$ choosing a sampling rate (i.e., how frequently the learning rate is updated/sampled from this profile). We propose a novel profile and sampling rate combination called the Reflected Exponential (REX) schedule, which we evaluate across seven different experimental settings with both SGD and Adam optimizers. REX outperforms the linear schedule in the low budget regime, while matching or exceeding the performance of several state-of-the-art learning rate schedules (linear, step, exponential, cosine, step decay on plateau, and OneCycle) in both high and low budget regimes. Furthermore, REX requires no added computation, storage, or hyperparameters.
研究の動機と目的
- トレーニング予算(エポック数)が不確実または限られている状況において、最適な学習率スケジュールを選択する課題に対処すること。
- 追加のハイパーパramータを必要とせず、低予算および高予算の両方の環境で良好に機能する単一の学習率スケジュールを特定すること。
- プロファイルとサンプリングレートの設計を通じて、学習率スケジュールの統一的フレームワークを提唱すること。
- 画像分類、物体検出、NLPを含む多様なディープラーニングタスクにおいて、提案されたスケジュールを実証的に検証すること。
提案手法
- 著者らは、プロファイルタイプ(連続関数)とサンプリングレート(更新頻度)の両方を最適化する問題として、学習率スケジュール選択を定式化した。
- 反転およびスケーリングされた指数関数的減衰関数として定義される、Reflected Exponential(REX)プロファイルを導入した。このプロファイルは、初期に高い値をとり、急速に減衰してから平坦化する。
- REXスケジュールは、各イテレーションごとに更新するサンプリングレートを採用しており、追加の計算コストなしに継続的な適応を実現している。
- 本手法は、CIFAR、ImageNet、COCO、GLUEベンチマーク上で、ResNet、DenseNet、YOLO、BERT、その他のモデルを用いた82の実験設定で評価された。
- SGDおよびAdam最適化手法の両方で、線形、ステップ、コサイン、指数関数的減衰、OneCycle、プレートウッド減衰スケジュールと比較された。
- 追加のハイパーパramータ、ストレージ、計算コストは一切不要であり、REXは既存のスケジュールの即時置き換えとして利用可能である。
実験結果
リサーチクエスチョン
- RQ1単一の学習率スケジュールが、低予算および高予算の両トレーニング環境で優れた性能を達成できるか?
- RQ2プロファイルタイプとサンプリングレートの組み合わせが、予算制約下での一般化性能およびロバスト性に与える影響は何か?
- RQ3REXスケジュールは、線形、ステップ、コサイン、OneCycleといった既存のスケジュールを、多様なディープラーニングタスクで上回るか?
- RQ4低予算設定において、初期学習率の選択が不適切であっても、REXスケジュールはロバストか?
- RQ5REXは追加のハイパーパramータや計算オーバーヘッドなしにデプロイ可能か?
主な発見
- REXは、全28の実験のうち70%でトップ1性能を達成し、92%の実験でトップ3性能を達成した。
- 低予算環境(全エポック数の1%、5%、10%)では、予算制約下での現在のゴールドスタンダードとされる線形スケジュールを上回った。
- 高予算環境(全エポック数の25%、50%、100%)では、OneCycleやコサイン減衰を含む、他のすべてのスケジュールと同等またはそれを上回る性能を示した。
- BERT BASE -GLUEベンチマークでは、1、2、3回のファインチューニングエポックにおいて、平均スコア82.8を達成し、線形スケジュール(82.6)とOneCycle(82.7)を上回った。
- 画像分類タスク(ResNet-20/CIFAR-10 および ResNet-38/CIFAR-100)において、REXは幅広い初期学習率の範囲で優れた性能を維持し、ロバスト性を示した。
- REXスケジュールは、さまざまな初期学習率においても相対的な順位を保ったままであり、最適でないハイパーパramータ設定下でも一貫した優位性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。