Skip to main content
QUICK REVIEW

[論文レビュー] Automated Learning Rate Scheduler for Large-batch Training

Chiheon Kim, Saehoon Kim|arXiv (Cornell University)|Jul 13, 2021
Advanced Neural Network Applications参考文献 29被引用数 7
ひとこと要約

本稿では、ガウス過程に基づくオンライン損失スムージングを用いて、ウォームアップ期間とピーク・ラーニングレートを動的に決定する、大バッチ学習向けの自動ラーニングレートスケジューラーAutoWUを提案する。指数的ウォームアップからコサイン減衰への適応的スイッチングにより、最小限のハイパーパrameterチューニングで、多様なアーキテクチャーやバッチサイズにおいてImageNetで最先端の性能を達成する。

ABSTRACT

Large-batch training has been essential in leveraging large-scale datasets and models in deep learning. While it is computationally beneficial to use large batch sizes, it often requires a specially designed learning rate (LR) schedule to achieve a comparable level of performance as in smaller batch training. Especially, when the number of training epochs is constrained, the use of a large LR and a warmup strategy is critical in the final performance of large-batch training due to the reduced number of updating steps. In this work, we propose an automated LR scheduling algorithm which is effective for neural network training with a large batch size under the given epoch budget. In specific, the whole schedule consists of two phases: adaptive warmup and predefined decay, where the LR is increased until the training loss no longer decreases and decreased to zero until the end of training. Here, whether the training loss has reached the minimum value is robustly checked with Gaussian process smoothing in an online manner with a low computational burden. Coupled with adaptive stochastic optimizers such as AdamP and LAMB, the proposed scheduler successfully adjusts the LRs without cumbersome hyperparameter tuning and achieves comparable or better performances than tuned baselines on various image classification benchmarks and architectures with a wide range of batch sizes.

研究の動機と目的

  • 大バッチ学習における最適化ステップの不足と不安定なラーニングレートスケジュールによる性能劣化という課題に対処すること。
  • 大バッチ設定におけるラーニングレートスケジュールの手動ハイパーパrameterチューニングの必要性を排除すること。
  • データ駆動的に最適なウォームアップ期間とピーク・ラーニングレートを検出できる、オンラインで適応可能なラーニングレートスケジューラーを開発すること。
  • トレーニング中に損失のフラクチュエーションに強く、同時に計算オーバーヘッドを低く保つこと。
  • 多様なモデルと大バッチサイズにおいて、手動チューニングされたベースラインと同等またはそれ以上の性能を達成すること。

提案手法

  • スケジューラーは2段階のプロセスで動作する:最初に、$10^{-5}$ から 1.0 まで指数関数的に増加する適応的ウォームアップ段階を経て、その後に定義済みの減衰段階へ移行する。
  • トレーニング損失をリアルタイムでスムージングするためにガウス過程(GP)が用いられ、最小損失点の検出が安定的に行える。この最小点がウォームアップから減衰への遷移を引き起こす。
  • 遷移条件は統計的検定に基づく:損失が最小に達している確率が信頼水準 $c$ を超えており、ノイズによる誤検出を避けるために忍耐期間 $p$ が設けられている。
  • ピーク・ラーニングレートは、検出された最小損失点における値として設定され、その後コサインスケジュールに従って減衰段階が開始される。
  • ウォームアップ段階では、成長率 $\gamma = (\eta_{\max}/\eta_{\min})^{1/\lfloor\rho_w T\rfloor}$ を用いた指数スケジュールが採用され、ここで $\rho_w$ はトレーニングステップのうちウォームアップに割り当てられる割合を制御する。
  • 本手法はAdamP や LAMB などの適応的最適化手法と互換性があり、大バッチ環境下での安定性と性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1大バッチ学習において、手動チューニングなしに最適なウォームアップ期間とピーク・ラーニングレートを自動で検出できるか?
  • RQ2GPに基づくオンライン損失スムージングは、ウォームアップ段階検出におけるトレーニングノイズへのロバストネスをどのように向上させるか?
  • RQ3異なるウォームアップ割合ハイパーパramータ($\rho_w$)が、さまざまなバッチサイズにおける最終モデル精度に与える影響は何か?
  • RQ4本手法は、手動チューニングされたベースラインや、SALSA などの先行自動化手法と比較して、大バッチ設定でどのように性能を発揮するか?
  • RQ5ハイパーパramータ($\eta_{\max}$)の選択に強く依存しないという点で、指数的ウォームアップは線形ウォームアップを上回るロバストネスを示すか?

主な発見

  • 指数的ウォームアップを用いたAutoWUは、バッチサイズ16,384、ResNet-50を用いたImageNetで75.22%のトップ-1精度を達成し、チューニング済みベースライン(75.02%)を上回った。
  • AutoWUにおける線形ウォームアップは $\eta_{\max}$ に極めて敏感であり、$\eta_{\max}=1.0$ の場合にのみ29.65%の精度にとどまり、指数的スケジューリングの優位性が顕著に示された。
  • $\rho_w = 0.25$ の場合、全バッチサイズで最高の性能を発揮し、4Kバッチサイズで76.60%の精度を記録した。$\rho_w = 0.125$ の場合の75.89%と比較して顕著な向上が得られた。
  • より大きなバッチサイズやより速いウォームアップ($\rho_w$ が小さい)では、減衰段階の開始ラーニングレートが上昇する傾向を示したが、極めて大きなバッチサイズではこのトレンドが崩れ、臨界バッチサイズ効果が顕在した。
  • 本手法は、複数のアーキテクチャーやデータセットにおいて一貫した性能向上を示し、ResNet-50 と ImageNet に限らない汎用性を示した。
  • 忍耐期間 $p=3$ が、ロバストネスとトレーニング安定性のバランスを最良にした。局所的な損失のフラクチュエーションへの感受性が低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。