Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic gradient descent with noise of machine learning type. Part II: Continuous time analysis

Stephan Wojtowytsch|arXiv (Cornell University)|Jun 4, 2021
Neural Networks and Applications被引用数 6
ひとこと要約

本稿は、確率的勾配降下法(SGD)を、機械学習的ノイズを有する連続時間において、確率微分方程式(SDE)を用いて分析する。古典的SGDとは異なり、ノイズが均一でない場合、非凸最適化において平坦な最小値への偏りが生じることを示している。これは、ノイズのスケーリングが目的関数値に依存するため、不変測度が損失関数の平坦な領域に集中するからである。

ABSTRACT

The representation of functions by artificial neural networks depends on a large number of parameters in a non-linear fashion. Suitable parameters of these are found by minimizing a 'loss functional', typically by stochastic gradient descent (SGD) or an advanced SGD-based algorithm. In a continuous time model for SGD with noise that follows the 'machine learning scaling', we show that in a certain noise regime, the optimization algorithm prefers 'flat' minima of the objective function in a sense which is different from the flat minimum selection of continuous time SGD with homogeneous noise.

研究の動機と目的

  • 過パラメータ化された深層学習で見られるように、目的関数値に比例してノイズがスケーリングされる状況における、確率的勾配降下法(SGD)の長期的挙動を理解すること。
  • グローバル最小値で消える機械学習固有のノイズが、古典的均一ノイズモデルと比較してSGDの不変分布に与える影響を調査すること。
  • ML型ノイズ下での長期的ダイナミクスに対して、ボルツマン分布が不適切なモデルであることを確立すること。
  • ノイズの退化性とスケーリングのおかげで、最適化プロセスが平坦な最小値を好むことを示すこと。
  • 新しいノイズ設定下で、関連するフォッカー・プランク作用素のスペクトル的性質を特徴付けるPoincaré-Hardy不等式を導出すること。

提案手法

  • ノイズ強度が損失関数の平方根に比例する連続時間イ伊ト型確率微分方程式(SDE)としてSGDをモデル化する:$ d heta_t = - abla L( heta_t) dt + rac{1}{2} abla heta_t rac{1}{ heta_t} dt + rac{1}{2} abla heta_t rac{1}{ heta_t} dt $。
  • 拡散過程の生成子に関連するフォッカー・プランク方程式を用いて、SDEの不変測度を分析する。
  • 幾何的性質と不変測度の集中を結びつけるために、新規のハーディー型不等式を用いて重み付きPoincaré不等式を確立する。
  • カットオフ関数技術とエネルギー推定を用いて、PDEの弱形式における勾配項の収束を証明する。
  • 楕円型PDEの局所的正則性理論を用いて、最小値集合における拡散行列の退化性を扱う。
  • 不変測度が、損失関数に依存するノイズスケーリングのおかげで、グローバル最小値集合に集中し、特に平坦な領域にバイアスがかかると証明する。

実験結果

リサーチクエスチョン

  • RQ1機械学習的ノイズを有するSGDの不変分布は、長期的に見て古典的ボルツマン分布とどのように異なるか?
  • RQ2グローバル最小値で消えるノイズが、非凸最適化における最小値選択に与える影響は何か?
  • RQ3目的関数に比例してノイズ強度がスケーリングされる退化型拡散過程に対して、Poincaré型不等式を確立できるか?
  • RQ4ML型ノイズ下では最適化プロセスが平坦な最小値を好むのか? もしそうなら、その理由は何か?
  • RQ5特に平坦性を特徴とする損失関数の幾何的構造が、損失依存ノイズ下での不変測度とどのように相互作用するか?

主な発見

  • ML型ノイズを有する連続時間SGDの不変測度は、グローバル最小値集合に集中するが、損失関数に依存するノイズスケーリングのため、平坦な領域にバイアスがかかる。
  • ノイズ強度が最小値で消えるため、標準的な平衡仮定が成り立たず、古典的ボルツマン分布は長期的ダイナミクスを記述できない。
  • 損失関数が最小値集合および無限遠点で二次的であると仮定すると、フォッカー・プランク作用素のスペクトル解析を可能にするPoincaré-Hardy不等式が確立される。
  • 証明は、カットオフ関数技術とエネルギー推定に依拠しており、弱形式における勾配項が極限で消えることを示し、最小値集合への集中を確認する。
  • この手法により、ノイズに起因するドリフトと拡散構造が、損失が小さいだけでなく平坦な領域をもたらすことを明らかにした。ノイズの大きさは損失値に比例するためである。
  • パラメータ空間の次元、損失関数の同次性、学習率のスケーリングとの整合性条件を満たせば、不変測度の存在が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。