Skip to main content
QUICK REVIEW

[論文レビュー] Hessian based analysis of SGD for Deep Nets: Dynamics and Generalization

Xinyan Li, Qilong Gu|arXiv (Cornell University)|Jul 24, 2019
Stochastic Gradient Optimization Techniques参考文献 76被引用数 6
ひとこと要約

本稿では、深層ニューラルネットワークにおける確率的勾配降下法(SGD)のヘッセ行列に基づく分析を提示し、2次情報を通じて最適化ダイナミクスと一般化を結びつける。スケール不変の一般化境界を、しきい値を適用したヘッセ行列に基づくガウス事後分布を用いて導入し、曲率と初期化からのパラメータシフトが一般化を共に決定することを示し、MNISTおよびCIFAR-10におけるラベルノイズの変動下での実証的検証を実施した。

ABSTRACT

While stochastic gradient descent (SGD) and variants have been surprisingly successful for training deep nets, several aspects of the optimization dynamics and generalization are still not well understood. In this paper, we present new empirical observations and theoretical results on both the optimization dynamics and generalization behavior of SGD for deep nets based on the Hessian of the training loss and associated quantities. We consider three specific research questions: (1) what is the relationship between the Hessian of the loss and the second moment of stochastic gradients (SGs)? (2) how can we characterize the stochastic optimization dynamics of SGD with fixed and adaptive step sizes and diagonal pre-conditioning based on the first and second moments of SGs? and (3) how can we characterize a scale-invariant generalization bound of deep nets based on the Hessian of the loss, which by itself is not scale invariant? We shed light on these three questions using theoretical results supported by extensive empirical observations, with experiments on synthetic data, MNIST, and CIFAR-10, with different batch sizes, and with different difficulty levels by synthetically adding random labels.

研究の動機と目的

  • 深層ネットワークにおける訓練損失のヘッセ行列と、確率的勾配(SGs)の2次モーメントとの関係を理解すること。
  • マルティングール差分列を用いて、固定ステップサイズおよび適応的ステップサイズ、対角予め条件付きを伴うSGDの確率的最適化ダイナミクスを特徴づけること。
  • ヘッセ行列の最小値における情報を利用し、再パrameterizationに対して不変であるスケール不変の一般化境界を構築すること。
  • データの難易度が変化する(例:ランダムラベル)条件下で、一般化誤差が損失の曲率および初期化からのパラメータシフトとどのように相関するかを調査すること。

提案手法

  • 損失、勾配、ヘッセ行列ダイナミクスの全分布を経験的に特徴付けるために、10,000回の独立したSGDトレーニングランを実施する。
  • ヘッセ行列の上位固有空間と、確率的勾配の2次モーメントとの整合性を分析し、SGDが2次情報の暗黙的利用を行っているかどうかを評価する。
  • マルティングール差分列を用いてSGDダイナミクスを確率過程としてモデル化し、大偏差境界および収束速度を導出する。
  • しきい値を適用したヘッセ行列から得られる精度行列を有する異方的ガウス事後分布を用いて、PACベイジアン一般化境界を提案する。
  • 対角的パラメータ再パラメータ化の下で不変であることを証明することで、事後分布と事前分布間のKLダイバージェンスのスケール不変性を確立する。
  • 2つのスケール不変量を定義する:しきい値を適用したヘッセ行列に基づく有効曲率と、初期化からのパラメータシフトの重み付きフロベニウスノルム。

実験結果

リサーチクエスチョン

  • RQ1損失のヘッセ行列は、深層ネットワークにおける確率的勾配の2次モーメントとどのように関係しているか?
  • RQ2マルティングール差分列を用いて、固定ステップサイズおよび適応的ステップサイズを伴うSGDの確率的ダイナミクスを理論的に特徴づける方法は何か?
  • RQ3ヘッセ行列がスケール不変性を欠いているにもかかわらず、損失のヘッセ行列を用いてスケール不変の一般化境界を構築できるか?
  • RQ4一般化境界の構成要素(曲率とパラメータシフト)は、ラベルノイズの増加や問題の難易度上昇に伴いどのように変化するか?

主な発見

  • ヘッセ行列の上位固有空間と、確率的勾配の2次モーメントとの間には、トレーニングの各イテレーションおよびデータセット全体にわたり一貫した整合性が観察され、SGDが2次情報の暗黙的利用を行っていることを示唆する。
  • 適応的ステップサイズまたは対角予め条件付きを用いることで、SGDダイナミクスをスーパーマルティングールに変換でき、適切な仮定の下で理論的収束保証が可能になる。
  • 提案された一般化境界はスケール不変性を有する:事後分布と事前分布間のKLダイバージェンスは、ネットワークの対角的再パラメータ化に対して不変のままである。
  • ランダムラベル設定下では、有効曲率と初期化からのパラメータシフトの重み付きフロベニウスノルムの両方が増加し、一般化誤差の上昇と相関する。
  • MNISTおよびCIFAR-10における経験的結果から、ラベルノイズが0%から15%に増加するに従い、一般化境界の値が高くなる傾向が観察され、その予測能力が裏付けられた。
  • ヘッセ行列の対角成分はラベルノイズに伴い増加し、局所的曲率が高くなることが示唆され、一般化境界の第1項に寄与する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。