Skip to main content
QUICK REVIEW

[論文レビュー] Demon: Improved Neural Network Training with Momentum Decay

John Chen, C. Wolfe|arXiv (Cornell University)|Oct 11, 2019
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文は、確率的勾配降下法にモーメンタムを組み合わせたSGDMおよびAdam最適化手法における、非線形減衰則に従って勾配のモーメンタムを動的に減少させる、新たなモーメンタム減衰スケジュール「Demon」を提案する。Demonは28種類の多様なディープラーニングタスクにおいて最先端の性能を達成し、学習率およびモーメンタムスケジュールの標準的手法(コサイン減衰やOneCycleを含む)をすべて上回り、ハイパーパrameterチューニングを一切不要とし、計算コストも無視できるほど小さい。

ABSTRACT

Momentum is a widely used technique for gradient-based optimizers in deep learning. In this paper, we propose a decaying momentum ( extsc{Demon}) rule. We conduct the first large-scale empirical analysis of momentum decay methods for modern neural network optimization, in addition to the most popular learning rate decay schedules. Across 28 relevant combinations of models, epochs, datasets, and optimizers, extsc{Demon} achieves the highest number of Top-1 and Top-3 finishes at 39\% and 85\% respectively, almost doubling the second-placed learning rate cosine schedule at 17\% and 60\%, respectively. extsc{Demon} also outperforms other widely used schedulers including, but not limited to, the learning rate step schedule, linear schedule, OneCycle schedule, and exponential schedule. Compared with the widely used learning rate step schedule, extsc{Demon} is observed to be less sensitive to parameter tuning, which is critical to training neural networks in practice. Results are demonstrated across a variety of settings and architectures, including image classification, generative models, and language models. extsc{Demon} is easy to implement, requires no additional tuning, and incurs almost no extra computational overhead compared to the vanilla counterparts. Code is readily available.

研究の動機と目的

  • ディープラーニング最適化におけるハイパーパrameter感受性、特に学習率およびモーメンタムスケジュールの広範なチューニングに依存する問題に対処すること。
  • 原理的かつ一貫したモーメンタム減衰戦略を導入することで、多様なアーキテクチャおよびデータセットにおいてモデルの汎化性能と学習安定性を向上させること。
  • 追加のチューニングなしに一貫して優れた性能を発揮するモーメンタムスケジュールを設計することで、ハイパーパrameter探索の計算的・人的コストを低減すること。
  • 実世界のディープラーニングベンチマーク(画像分類、言語モデリング、生成モデリングを含む)において、標準的な学習率スケジュールと比較して、モーメンタム減衰の有効性を評価すること。

提案手法

  • Demonは、訓練の進行に従い初期値β_initから0に減少する非線形モーメンタム減衰スケジュールを実装しており、次の式に従う:β_t = β_init * (1 - t/T) / [(1 - β_init) + β_init * (1 - t/T)]。
  • 減衰則は、初期段階で高いモーメンタムを維持することで収束を高速化し、後期段階でモーメンタムを減少させることで汎化性能と安定性を向上させるように設計されている。
  • SGDMおよびAdam最適化手法の両方と互換性があり、それぞれのアルゴリズムに特化した定式化がなされており、広範な適用性を有する。
  • 計算効率が高く、1イテレーションあたり1回の追加計算のみでβ_tを算出可能であり、追加メモリや顕著なオーバーヘッドを伴わない。
  • PyTorchで実装され、公開されており、既存の学習パイプラインへの容易な統合が可能である。
  • 著者らは、10種類の既存の学習率およびモーメンタムスケジュールと比較するため、28のモデル-データセット-最適化手法-エポックの組み合わせを用いた大規模な実証的評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1非線形モーメンタム減衰スケジュールは、多様なディープラーニングタスクにおいて、最終的なモデル精度とロバスト性の面で、標準的な学習率減衰スケジュールを上回るか?
  • RQ2コサイン、ステップ、線形、OneCycleといった広く使われる学習率スケジュールと比較して、Demonは複数のベンチマークにおけるTop-1およびTop-3性能でどのように差をつけるか?
  • RQ3学習率ステップ減衰などの標準的スケジュールと比較して、Demonはハイパーパrameterチューニングへの感受性をどの程度低減するか?
  • RQ4DemonはSGDMおよびAdam最適化手法の両方に対して効果的に適用可能であり、異なるアーキテクチャおよびデータセットにおいて一貫した性能向上を達成できるか?
  • RQ5Demonの性能向上は、単純な有効学習率の調整に起因するのか、それとも最適化軌道におけるより複雑なダイナミクスに起因するのか?

主な発見

  • Demonは28回の実験において、最多のTop-1順位獲得率(39.29%)を達成し、次に優れた方法(コサイン減衰スケジュール、17.86%)を大きく上回った。
  • DemonはTop-3順位獲得率85.71%を達成し、2番目に優れた方法(コサイン減衰スケジュール、60.71%)のほぼ2倍の性能を示した。
  • CIFAR-10におけるResNet-20の画像分類タスクでは、Demon SGDMがテスト誤差をSGD ELRの8.71%から改善し、ベースラインのSGD ELR比で0.5%の向上を達成した。
  • GLUEに微調整されたBERT baseモデルでは、Demon AdamがCoLAタスクで0.6ポイント向上(79.7 vs. 79.1)、QNLIタスクで0.5ポイント向上(90.0 vs. 89.0)を達成し、追加のチューニングなしに実現した。
  • MNIST用のVAE学習では、Demon SGDMが100エポックで一般化誤差を138.29から136.55に低下させたのに対し、SGD ELRは発散した。これはDemonの安定性を示している。
  • 視覚、自然言語処理、生成モデリングの各タスクにおいて、OneCycle、ステップ、線形、指数減衰を含む、他のすべてのモーメンタムおよび学習率スケジュールを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。