Skip to main content
QUICK REVIEW

[論文レビュー] Training Deep Neural Networks with Adaptive Momentum Inspired by the Quadratic Optimization

Tao Sun, Huaming Ling|arXiv (Cornell University)|Oct 18, 2021
Advanced Neural Network Applications参考文献 45被引用数 5
ひとこと要約

この論文は、二次的最適化における最適なモーメンタム選択にインspiredされた、深層ニューラルネットワークの学習のための適応的モーメンタム手法を提案する。勾配とパラメータの変化に基づいてモーメンタム係数を動的に調整することにより、SGDおよびAdamにおける収束速度の向上、学習率に対するロバストネスの向上、一般化性能の向上が達成され、凸および非凸設定の両方で理論的収束保証が与えられる。

ABSTRACT

Heavy ball momentum is crucial in accelerating (stochastic) gradient-based optimization algorithms for machine learning. Existing heavy ball momentum is usually weighted by a uniform hyperparameter, which relies on excessive tuning. Moreover, the calibrated fixed hyperparameter may not lead to optimal performance. In this paper, to eliminate the effort for tuning the momentum-related hyperparameter, we propose a new adaptive momentum inspired by the optimal choice of the heavy ball momentum for quadratic optimization. Our proposed adaptive heavy ball momentum can improve stochastic gradient descent (SGD) and Adam. SGD and Adam with the newly designed adaptive momentum are more robust to large learning rates, converge faster, and generalize better than the baselines. We verify the efficiency of SGD and Adam with the new adaptive momentum on extensive machine learning benchmarks, including image classification, language modeling, and machine translation. Finally, we provide convergence guarantees for SGD and Adam with the proposed adaptive momentum.

研究の動機と目的

  • SGDおよびAdamにおけるモーメンタムハイパーパramータの手動チューニングの必要性を排除すること。
  • 最適化ダイナミクスに基づいて動的に調整される、原理的で適応的なモーメンタムスキームの開発。
  • 大きな学習率に対してもロバストな学習の安定性を向上させ、一般化性能を向上させること。
  • 提案された適応的モーメンタムの凸および非凸最適化設定における理論的収束保証の提供。

提案手法

  • 適応的モーメンタム係数 $\beta_{k+1}$ は、二次的最適化における最適モーメンタムから導出された式により計算される:$\beta_{k+1} = \text{Proj}_{[0,1-\delta]}\left(\left[1 - \sqrt{\gamma \frac{\|\mathbf{g}^k - \mathbf{g}^{k-1}\|}{\|\mathbf{x}^k - \mathbf{x}^{k-1}\|}}\right]^2\right)$ for $k \geq 2$。
  • 勾配およびパラメータの差の $\ell_2$ ノルムを用いて曲率を推定し、動的モーメンタム調整を可能にする。
  • この手法は、標準的なSGDおよびAdamに統合され、固定された $\beta$ を適応的 $\beta_{k+1}$ に置き換える。
  • 投影演算子により $\beta_{k+1} \in [0, 1 - \delta]$ を保証し、実験では $\delta = 10^{-3}$ を使用。
  • 理論的分析により、凸および非凸設定の両方で適応的モーメンタムの収束性が確立され、近接型HBおよびAdamの変種を含む。
  • 画像分類、言語モデリング、機械翻訳のベンチマークで検証が行われた。

実験結果

リサーチクエスチョン

  • RQ1SGDおよびAdamにおけるモーメンタムハイパーパramータ $\beta$ の手動チューニングを不要にする適応的モーメンタムを設計できるか?
  • RQ2提案された適応的モーメンタムは、深層ニューラルネットワークの学習において収束速度および一般化性能を向上させるか?
  • RQ3異なる機械学習タスクにおいて、大きな学習率に対しても適応的モーメンタムはロバストか?
  • RQ4提案された適応的モーメンタムを用いたSGDおよびAdamについて、理論的収束保証を提供できるか?

主な発見

  • 評価されたすべてのベンチマークで、提案された適応的モーメンタムを用いたSGDおよびAdamは、ベースライン手法よりも高速に収束する。
  • 適応的モーメンタム手法は、標準的なSGDおよびAdamよりも一般化性能が優れており、特に大きな学習率下で顕著である。
  • 学習率ハイパーパramータに対して高いロバストネスを示し、学習率が最適でない場合でも性能を維持する。
  • 凸および非凸設定の両方で、近接型HBおよびAdamの変種を含む理論的収束性が確立された。
  • 画像分類、言語モデリング、機械翻訳における実験結果から、一貫した性能向上が確認された。
  • 適応的モーメンタムスキームは、$\beta$ の手動チューニングを必要とせず、複数の標準ベンチマークで最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。