Skip to main content
QUICK REVIEW

[論文レビュー] Large-Batch Training for LSTM and Beyond

Yang You, Jonathan Hseu|arXiv (Cornell University)|Jan 24, 2019
Advanced Neural Network Applications参考文献 27被引用数 12
ひとこと要約

本論文は、理論的裏付けのあるSqrtスケーリング学習率方式を用いて、LSTMおよびCNNモデルの両方における効果的な大バッチ学習を可能にする自動ハイパーパramータチューニング手法であるLinear-Epoch Gradual-Warmup(LEGW)を提案する。LEGWはLSTMタスクで平均5.3倍の高速化を達成し、手動チューニングなしでバッチサイズを32Kまで拡大しても精度を維持する。従来の線形スケーリング手法を上回る性能を示す。

ABSTRACT

Large-batch training approaches have enabled researchers to utilize large-scale distributed processing and greatly accelerate deep-neural net (DNN) training. For example, by scaling the batch size from 256 to 32K, researchers have been able to reduce the training time of ResNet50 on ImageNet from 29 hours to 2.2 minutes (Ying et al., 2018). In this paper, we propose a new approach called linear-epoch gradual-warmup (LEGW) for better large-batch training. With LEGW, we are able to conduct large-batch training for both CNNs and RNNs with the Sqrt Scaling scheme. LEGW enables Sqrt Scaling scheme to be useful in practice and as a result we achieve much better results than the Linear Scaling learning rate scheme. For LSTM applications, we are able to scale the batch size by a factor of 64 without losing accuracy and without tuning the hyper-parameters. For CNN applications, LEGW is able to achieve the same accuracy even as we scale the batch size to 32K. LEGW works better than previous large-batch auto-tuning techniques. LEGW achieves a 5.3X average speedup over the baselines for four LSTM-based applications on the same hardware. We also provide some theoretical explanations for LEGW.

研究の動機と目的

  • RNNの一種であるLSTMの広範な使用にもかかわらず、大バッチ学習の有効な手法が不足している問題に対処する。
  • CNNにおいてバッチサイズを8Kを超えて拡大する際、膨大なハイパーパramータチューニングを回避する。
  • 理論的Sqrtスケーリングと実践的で大規模バッチ学習の間のギャップを埋める。これまでの実用的応用は限定的であった。
  • 多様なアーキテクチャにわたって、モデルの精度を維持しながら訓練速度を最大化する自動的かつ頑健な手法を開発する。
  • RNNおよびCNNワークロードの両方でLEGWの有効性を実証し、一貫した性能向上を示す。

提案手法

  • 学習率をバッチサイズの平方根に比例してスケーリングする学習率ウォームアップ戦略として、Linear-Epoch Gradual-Warmup(LEGW)を提案する。
  • 先行研究が理論的に支持するように、勾配分散の安定性を維持するためSqrtスケーリングを適用する。
  • 固定されたエポック数にわたり線形に増加するウォームアップスケジュールを採用し、ウォームアップ期間をバッチサイズの逆数に比例させる。
  • CNN向けにLARSなどの既存の最適化手法、RNN向けに標準的なSGDと統合することで、互換性と性能を確保する。
  • バッチサイズに基づいて自動的に学習率とウォームアップ期間を決定し、手動チューニングを不要にする。
  • 複数のベンチマークで手法を検証:GNMT(LSTM)、PTB(LSTM)、およびResNet50を用いたImageNet(CNN)

実験結果

リサーチクエスチョン

  • RQ1Sqrtスケーリングは、RNNおよびCNNの両方における大バッチ学習に実際的に効果的に適用可能か?
  • RQ2バッチサイズを8Kを超えて拡大する際、LEGWは手動ハイパーパramータチューニングの必要性を排除できるか?
  • RQ3LEGWは線形スケーリングや他の自動チューニング手法と比較して、精度および速度の面で優れているか?
  • RQ4LEGWは、LSTMおよびCNNモデルの両方でバッチサイズを32Kまで拡大してもモデルの精度を維持できるか?
  • RQ5LEGWが大バッチサイズでの学習安定化に有効である理論的根拠は何か?

主な発見

  • GNMT(LSTM)において、バッチサイズを256から4096に拡大しても、ハイパーパramータチューニングなしでBLEUスコア22.2を維持する。
  • PTB(LSTM)において、バッチサイズを8192(32倍増加)に拡大しても、精度に低下はなく、チューニングなしで性能を維持する。
  • ResNet50を用いたImageNetにおいて、バッチサイズ32,768で93.18%のtop-5精度を達成し、チューニングなしでベンチマーク水準を維持する。
  • 同じTPU-v2ハードウェア上で4つのLSTMベースのアプリケーションにおいて、LEGWはベースライン比で平均5.3倍の高速化を達成する。
  • LEGWは従来の自動チューニング手法や線形スケーリング方式を上回り、極端なバッチサイズでも高い精度を維持する。
  • 本手法は多様なモデルにおいて一貫した性能を示し、RNNおよびCNN両環境で高い頑健性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。