Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Adaptive and Accelerated Stochastic Gradient Descent

Qi Deng, Yi Cheng|arXiv (Cornell University)|Oct 1, 2018
Stochastic Gradient Optimization Techniques参考文献 5被引用数 8
ひとこと要約

本稿では、Nesterov型加速(モーメンタム)と適応的対角スケーリング(AdaGrad/Adamにインspired)を統合する、新しい自己適応的かつ高速化された確率的勾配降下法A2Gradを提案する。収束複雑度を決定的および確率的成分に理論的に分解することにより、A2Gradは最適な $ϳ(\frac{L}{k^{2}} + \frac{\sigma}{\sqrt{k}})$ 収束レートを達成する一方で、データに適応するステップサイズと柔軟な移動平均スキームを組み込み、ディープラーニングベンチマークにおいて優れた最適化および一般化性能を示す。

ABSTRACT

Stochastic gradient descent ( extsc{Sgd}) methods are the most powerful optimization tools in training machine learning and deep learning models. Moreover, acceleration (a.k.a. momentum) methods and diagonal scaling (a.k.a. adaptive gradient) methods are the two main techniques to improve the slow convergence of extsc{Sgd}. While empirical studies have demonstrated potential advantages of combining these two techniques, it remains unknown whether these methods can achieve the optimal rate of convergence for stochastic optimization. In this paper, we present a new class of adaptive and accelerated stochastic gradient descent methods and show that they exhibit the optimal sampling and iteration complexity for stochastic optimization. More specifically, we show that diagonal scaling, initially designed to improve vanilla stochastic gradient, can be incorporated into accelerated stochastic gradient descent to achieve the optimal rate of convergence for smooth stochastic optimization. We also show that momentum, apart from being known to speed up the convergence rate of deterministic optimization, also provides us new ways of designing non-uniform and aggressive moving average schemes in stochastic optimization. Finally, we present some heuristics that help to implement adaptive accelerated stochastic gradient descent methods and to further improve their practical performance for machine learning and deep learning.

研究の動機と目的

  • 適応的勾配法(例:AdaGrad, Adam)と加速型(モーメンタムベース)確率的勾配降下法を組み合わせる際の理論的ギャップを埋めること。
  • 適応的ステップサイズとモーメンタムの相互作用を説明する統一理論的枠組みを構築すること。
  • 滑らかで確率的な最適化に対して最適な収束レートを達成する、新しい自己適応的加速型SGDのクラスを設計すること。
  • ディープラーニングモデルにおける実用的ヒューリスティクスを導出し、A2Gradの実装と実効的性能を向上させること。
  • 指数的移動平均と均等平均が同一の理論的分析の下で統一可能であることを示し、収束保証を明示すること。

提案手法

  • Nesterovのモーメンタムと適応的対角スケーリングを統合する、新しい自己適応的かつ加速型確率的勾配降下法A2Gradを提案する。
  • 収束複雑度の新規分解を導入:決定的部分(モーメンタムによる加速)と確率的部分(適応的ステップサイズによる改善)。
  • 均等および非均等な移動平均スキーム(指数的移動平均を特別ケースとして含む)を統一フレームワークで分析する。
  • Lipschitz定数 $L$ と適応的パラメータ $\beta_0$ のグリッドサーチを用いたパラメータ推定戦略を採用し、過去の勾配の移動平均を用いて実効的分散を推定する。
  • 特徴量ごとの分散を捉える $h_k$ と減衰を制御する $\beta_k$ を用いた適応的パラメータ $\gamma_k$ および $\beta_k h_k$ を用いた更新式の再定式化。
  • 均等および2次加重平均の両方を許容するハイブリッド移動平均スキームを適用し、最適な収束レートを維持する。

実験結果

リサーチクエスチョン

  • RQ1適応的勾配法を確率的最適化においてNesterov型加速と効果的に組み合わせても、収束保証を損なわずに実現可能か?
  • RQ2収束レートの向上に寄与するモーメンタム(加速)と適応的ステップサイズの理論的相互作用は何か?
  • RQ3指数的移動平均スキームは加速フレームワーク内で理論的に正当化可能か? また、ほぼ最適または最適な収束レートを達成するか?
  • RQ4均等平均を超えた非均等でデータに適応するスケーリングを、最適性を維持したまま拡張可能か?
  • RQ5ディープラーニングにおける自己適応的加速型SGDの実装と一般化性能を向上させるための実用的ヒューリスティクスは何か?

主な発見

  • A2Gradは、滑らかな確率的最適化に対して最適な最悪ケース収束レート $\mathcal{O}(\frac{L}{k^{2}} + \frac{\sigma}{\sqrt{k}})$ を達成し、既知の最良レートと一致する。
  • データに適応するステップサイズにより、確率的項 $\frac{\sigma}{\sqrt{k}}$ が改善され、標準的なSGDやAdamよりも高速な収束を実現する。
  • 指数的移動平均は提案フレームワークの特別なケースとして示され、サブガウス型仮定下でほぼ最適な収束を達成する。
  • 勾配ノルムの有界性仮定下では、A2Gradの収束レートを最適化に改善でき、理論的頑健性を示す。
  • MNISTおよびCIFAR10における実験結果から、A2Gradは訓練損失およびテスト精度の両面でAdamやAMSGradを上回るか同等の性能を示し、より優れた一般化性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。