Skip to main content
QUICK REVIEW

[論文レビュー] How noise affects the Hessian spectrum in overparameterized neural networks

Mingwei Wei, David J. Schwab|arXiv (Cornell University)|Oct 1, 2019
Stochastic Gradient Optimization Techniques参考文献 25被引用数 10
ひとこと要約

この論文は、過パラメータ化されたニューラルネットワークの縮退した損失の谷において、確率的勾配降下法(SGD)がヘッセ行列のトレースを低減することを示している。フラクチュエーション・ディスシペーショング関係を用いて、SGDのノイズがヘッセ行列トレースを体系的に低下させることを示し、非縮退方向における等方的ノイズがヘッセ行列行列式を低減することを示しており、一般化のメカニズムを提供するとともに、新たな最適化手法の設計を導く。

ABSTRACT

Stochastic gradient descent (SGD) forms the core optimization method for deep neural networks. While some theoretical progress has been made, it still remains unclear why SGD leads the learning dynamics in overparameterized networks to solutions that generalize well. Here we show that for overparameterized networks with a degenerate valley in their loss landscape, SGD on average decreases the trace of the Hessian of the loss. We also generalize this result to other noise structures and show that isotropic noise in the non-degenerate subspace of the Hessian decreases its determinant. In addition to explaining SGDs role in sculpting the Hessian spectrum, this opens the door to new optimization approaches that may confer better generalization performance. We test our results with experiments on toy models and deep neural networks.

研究の動機と目的

  • 過パラメータ化されたネットワークにおけるSGDが、1次情報のみを用いてもなぜ一般化性能が優れているのかを説明すること。
  • SGDのノイズがヘッセ行列スペクトルに与える影響、特に縮退した損失の谷においてどのように影響を与えるかを調査すること。
  • ヘッセ行列トレースおよび行列式の進化を制御するノイズ共分散構造を導出することにより、一般化を向上させること。
  • 理論的予測を、トゥイモデルおよびディープニューラルネットワークにおける実験で検証すること。
  • 制御されたヘッセ行列進化に基づく新しい最適化アルゴリズムの設計への道筋を開くこと。

提案手法

  • フラクチュエーション・ディスシペーショング関係(Yaida, 2019)を用いた理論的分析により、パラメータ空間におけるSGDノイズがヘッセ行列に与える影響をモデル化する。
  • 損失関数が非縮退および縮退部分空間に分けられる二次形式として近似される最小限の谷構造を定義する。
  • 異なるノイズ共分散構造の下でヘッセ行列トレースおよび行列式の進化を導出し、SGDノイズがトレースを低減し、等方的ノイズが行列式を低減することを示す。
  • 非非退化および縮退部分空間を分離するための座標変換を適用し、ヘッセ行列固有値ダイナミクスの解析を可能にする。
  • 学習率およびノイズ構造を変化させた場合のトレースおよび行列式の進化をテストするため、制御された損失関数を用いたトゥイモデルを用いた実験を行う。
  • SGDの軌道に沿った投影パスを用いてヘッセ行列トレースの進化を推定し、数値推定(Bai et al., 1996)により検証する。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化されたネットワークにおける縮退した損失の谷において、SGDのノイズはヘッセ行列トレースにどのように影響を与えるか?
  • RQ2最適化中にヘッセ行列行列式の進化を制御できるようなノイズ共分散構造を設計できるか?
  • RQ3損失関数のランドスケープに沿った投影されたSGDパスにおいて、ヘッセ行列トレースは減少するか?
  • RQ4ヘッセ行列トレースの進化は学習率およびノイズ分散にどのように依存するか?
  • RQ5ヘッセ行列トレースの進化は一般化性能とどの程度相関するか?

主な発見

  • SGDのノイズは、縮退した谷においてヘッセ行列トレースを平均的に低減する。これは、より平坦な極小点への傾向と整合的である。
  • トレースの進化率はη²に比例し、勾配ステップの拡張と非非退化方向における平衡統計の両方の寄与から成る。
  • 非非退化部分空間における等方的ノイズはヘッセ行列行列式を低減する。これは、鋭い極小点からの脱出メカニズムを示唆する。
  • トゥイモデルにおける実験により、訓練損失と負のヘッセ固有値の和との間には線形関係が確認された。
  • Preact-ResNet18およびVGG16における投影パス解析により、バリデーション損失が増加している間でさえも、ヘッセ行列トレースが減少することが示された。
  • 観察されたヘッセ行列トレースの進化は理論的予測と一致し、ノイズが一般化性能の向上に寄与するヘッセ行列スペクトルの形状を決定づける役割を果たしていることを支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。