Skip to main content
QUICK REVIEW

[論文レビュー] On the Generalization of Stochastic Gradient Descent with Momentum

Ali Ramezani-Kebrya, Antonakopoulos, Kimon|arXiv (Cornell University)|Sep 12, 2018
Stochastic Gradient Optimization Techniques参考文献 37被引用数 11
ひとこと要約

本稿では、初期学習エポックにのみモーメンタムを適用するように変更された確率的勾配降下法の変種、SGDEM(SGD with early momentum)を提案する。標準的なSGDMは凸損失関数において安定性ギャップが無限大に発散する可能性があるが、SGDEMは滑らかでリプシッツ連続な関数および強い凸関数に対して一般化を保証する。理論的境界として期待真のリスクの上界を導出し、ResNet-18およびロジスティック回帰モデルにおける実験的検証も実施した。

ABSTRACT

While momentum-based accelerated variants of stochastic gradient descent (SGD) are widely used when training machine learning models, there is little theoretical understanding on the generalization error of such methods. In this work, we first show that there exists a convex loss function for which the stability gap for multiple epochs of SGD with standard heavy-ball momentum (SGDM) becomes unbounded. Then, for smooth Lipschitz loss functions, we analyze a modified momentum-based update rule, i.e., SGD with early momentum (SGDEM) under a broad range of step-sizes, and show that it can train machine learning models for multiple epochs with a guarantee for generalization. Finally, for the special case of strongly convex loss functions, we find a range of momentum such that multiple epochs of standard SGDM, as a special form of SGDEM, also generalizes. Extending our results on generalization, we also develop an upper bound on the expected true risk, in terms of the number of training steps, sample size, and momentum. Our experimental evaluations verify the consistency between the numerical results and our theoretical bounds. SGDEM improves the generalization error of SGDM when training ResNet-18 on ImageNet in practical distributed settings.

研究の動機と目的

  • モーメンタムを用いたSGDの変種(例:SGDM)における一般化の理論的理解の不足に対処すること。
  • 複数エポックにわたる凸損失関数に対しても、標準的なSGDMが無限大に発散する安定性ギャップを示す可能性があることの証明。
  • 初期学習段階にのみモーメンタムを適用するように変更した更新則であるSGDEMを提案し、一般化の保証を可能にすること。
  • 訓練ステップ数、サンプルサイズ、モーメンタムパラメータを用いた期待真のリスクの上界を導出すること。
  • ResNet-18(ImageNet)およびロジスティック回帰(notMNIST/MNIST)を用いた実験的検証を通じて、調整されたモーメンタム適用期間による一般化性能の向上を示すこと。

提案手法

  • SGDEMを導入する。これは、最初の $ t_d $ エポックにのみモーメンタムを適用し、その後は無効化することで一般化行動を制御するSGDMの変種である。
  • 滑らかでリプシッツ連続な関数および強い凸関数の損失関数において、SGDEMの一般化誤差を一様安定性の枠組みで分析する。
  • ステップサイズ、モーメンタム、訓練ステップ数、サンプルサイズを組み込んだ安定性解析を用いて、期待真のリスクの上界を導出する。
  • 滑らかでリプシッツ連続な関数に対して、SGDEMは広範なステップサイズ条件のもとで、モーメンタム値に依存せずに一般化することを証明する。
  • 強い凸関数に対しては、標準的なSGDM(SGDEMの特殊ケース)がモーメンタムが特定の範囲内にある場合に一般化することを確立する。
  • ResNet-18(ImageNet)およびロジスティック回帰(notMNIST/MNIST)を用いた実験により、理論的境界を検証し、異なるモーメンタムスケジュールにおける一般化誤差およびテスト精度を比較する。

実験結果

リサーチクエスチョン

  • RQ1重力ボールモーメンタムを用いた標準的なSGDMは、複数エポックにわたる凸損失関数において、無限大に発散する安定性ギャップを示すか?
  • RQ2初期段階でのみモーメンタムを適用する更新則(SGDEM)は、広範なステップサイズ条件のもとで滑らかでリプシッツ連続な損失関数に対して一般化を保証できるか?
  • RQ3強い凸損失関数の場合、標準的なSGDMが一般化するためのモーメンタム値の範囲は何か?
  • RQ4実用的な学習シナリオにおいて、モーメンタム適用期間($ t_d $)が一般化誤差に与える影響は何か?
  • RQ5SGDEMの期待真のリスクに対する理論的上界を導出し、実験的に検証できるか?

主な発見

  • 特定の凸損失関数に対して、標準的なSGDMの安定性ギャップは複数エポックにわたって無限大に発散することが判明し、一般化に悪影響を及える可能性があることが示された。
  • SGDEMは、広範なステップサイズ条件のもとで、モーメンタム値に依存せず滑らかでリプシッツ連続な損失関数に対して一般化を保証する。
  • 強い凸関数に対しては、標準的なSGDMがモーメンタムパラメータが特定の範囲内にある場合に一般化することが示され、これは新たな理論的貢献である。
  • 期待真のリスクの理論的上界が導出され、数値結果と整合的であることが示された。最適な $ \tilde{t}^* $ は非解析的方程式の数値的解法により決定された。
  • 分散環境下でImageNetを用いてResNet-18を学習した結果、モーメンタムを90エポック中50エポックのみに限定したSGDEMは、SGDMよりも低い一般化誤差を達成した。
  • notMNISTおよびMNISTにおけるロジスティック回帰実験では、テスト精度がモーメンタムを限定されたエポック数に適用した際にピークに達し、長期間のモーメンタム適用が一般化性能を低下させる可能性があることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。