Skip to main content
QUICK REVIEW

[論文レビュー] SGD momentum optimizer with step estimation by online parabola model

Jarek Duda|arXiv (Cornell University)|Jul 16, 2019
Stochastic Gradient Optimization Techniques参考文献 13被引用数 9
ひとこと要約

本稿では、勾配下降法のモーメンタムフレームワーク内に、1階微分の勾配のみを用いて最適ステップサイズを推定するオンライン放物線モデルのアプローチを提案する。モーメンタム方向に沿った勾配の傾向を追跡するためにオンライン線形回帰を適用することで、曲率を近似し、計算コストを最小限に抑えつつ、第二階級に類似したステップサイズの適応的調整を可能にし、深層学習における非凸最適化の収束性を向上させる。

ABSTRACT

In stochastic gradient descent, especially for neural network training, there are currently dominating first order methods: not modeling local distance to minimum. This information required for optimal step size is provided by second order methods, however, they have many difficulties, starting with full Hessian having square of dimension number of coefficients. This article proposes a minimal step from successful first order momentum method toward second order: online parabola modelling in just a single direction: normalized $\hat{v}$ from momentum method. It is done by estimating linear trend of gradients $\vec{g}= abla F(\vecθ)$ in $\hat{v}$ direction: such that $g(\vecθ_\bot+θ\hat{v})\approx λ(θ-p)$ for $θ= \vecθ\cdot \hat{v}$, $g= \vec{g}\cdot \hat{v}$, $\vecθ_\bot=\vecθ-θ\hat{v}$. Using linear regression, $λ$, $p$ are MSE estimated by just updating four averages (of $g$, $θ$, $gθ$, $θ^2$) in the considered direction. Exponential moving averages allow here for inexpensive online estimation, weakening contribution of the old gradients. Controlling sign of curvature $λ$, we can repel from saddles in contrast to attraction in standard Newton method. In the remaining directions: not considered in second order model, we can simultaneously perform e.g. gradient descent. There is also discussed its learning rate approximation as $μ=σ_θ/ σ_g$, allowing e.g. for adaptive SGD - with learning rate separately optimized (2nd order) for each parameter.

研究の動機と目的

  • 深層学習における確率的勾配降下法(SGD)の最適ステップサイズ選択の課題に取り組むこと。第一階級の手法は曲率の認識を欠いている。
  • オンライン線形回帰を用いてモーメンタム方向に沿った勾配の傾向をモデル化することで、低コストな第二階級近似を導入すること。
  • パラメータと勾配の標準偏差の比($\sigma_\theta / \sigma_g$)を用いた学習率の近似により、各パラメータごとの適応的学習率を実現し、逆ヘッセ行列の対角成分を近似すること。
  • 1方向における曲率の符号制御により、停留在点からの反発を検出・実行することで収束性を向上させること。
  • 計算コストが低く、オンラインで行える形で、第一階級のモーメンタムの効率性と第二階級の洞察を統合すること。

提案手法

  • モーメンタム方向 $\hat{v}$ に沿って、$\overline{g}$, $\overline{\theta}$, $\overline{g\theta}$, および $\overline{\theta^2}$ の4つの統計量の指数的移動平均を用い、勾配の傾向に対するオンライン線形回帰を実行する。
  • 勾配 $g(\theta) \approx \lambda(\theta - p)$ をモーメンタムベクトル $\vec{v}$ の方向にモデル化し、$\lambda$ を曲率、$p$ を最小値の推定位置とする。
  • 線形回帰のパラメータから導出される $\eta \propto \lambda^{-1}$ を用いて、ニュートン法に類似したステップサイズを推定する。
  • 逆ヘッセ行列の対角成分の近似として実用的かつ効果的な近似学習率 $\mu = \sigma_\theta / \sigma_g$ を導入し、パラメータごとの適応的SGDを可能にする。
  • 1方向における曲率の符号制御により、停留在点への吸引を回避し、モデル化された方向で停留在点フリーの最適化行動を実現する。
  • 最近の勾配のオンライン主成分分析(PCA)を用いて低次元部分空間を特定し、ヘッセ行列の近似を高次元に拡張する。正規直交基底を維持し、$d \times d$ のヘッセ行列推定値を更新する。

実験結果

リサーチクエスチョン

  • RQ1第一階級の勾配のみを用いて、SGDモーメンタムフレームワークに最小限の第二階級近似を効率的に統合できるか?
  • RQ21方向における勾配傾向のオンライン線形回帰が、安定的かつ適応的なステップサイズ推定を可能にし、収束性を向上させられるか?
  • RQ3比 $\sigma_\theta / \sigma_g$ が、適応的学習率のための実用的かつ効果的な逆ヘッセ行列対角成分の近似として機能できるか?
  • RQ41方向における曲率の符号制御が、停留在点からの反発を可能にし、最適化の安定性を向上させられるか?
  • RQ5オンラインPCAを用いて高次元部分空間に拡張できるか。計算コストは低く保たれるか?

主な発見

  • 4つのオンライン平均のみで第二階級の洞察を実現し、計算コストを最小限に抑えつつ、曲率に配慮したステップサイズ推定が可能となった。
  • 学習率近似 $\mu = \sigma_\theta / \sigma_g$ は、完全なヘッセ行列の逆行列を求めるのではなく、対角ヘッセ行列の逆行列を近似する実用的で適応的な代替手段を提供する。
  • 曲率の符号制御により、停留在点への吸引を回避でき、標準的なニュートン法の主な限界を克服した。
  • 標準的なモーメンタムおよび勾配降下法と互換性を保ち、ハイブリッド最適化戦略の実現を可能にした。
  • オンラインPCAを用いて高次元部分空間への拡張が可能であり、$d \approx 10$ 次元程度で支配的ヘッセ構造を捉えるのに十分である。
  • 実験的結果から、オンライン放物線モデルが、局所的な曲率傾向に基づいたステップサイズの適応により、収束が速くなり、一般化性能が向上することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。