Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Bias of SGD for Diagonal Linear Networks: a Provable Benefit of Stochasticity

Scott Pesme, Loucas Pillaud‐Vivien|arXiv (Cornell University)|Jun 17, 2021
Stochastic Gradient Optimization Techniques被引用数 7
ひとこと要約

この論文は、対角線形ネットワーク上での確率的勾配フロー(SGF)が、勾配フロー(GF)よりも明示的な正則化なしに、構造的ノイズに起因するstochasticityのおかげで、一般化性能が優れた解を選択する、証明可能なより良い暗黙的バイアスを示している。訓練損失の収束が遅いほど、一般化性能の優れた解へのバイアスが強くなる。厳密な収束保証と実験的検証が得られている。

ABSTRACT

Understanding the implicit bias of training algorithms is of crucial importance in order to explain the success of overparametrised neural networks. In this paper, we study the dynamics of stochastic gradient descent over diagonal linear networks through its continuous time version, namely stochastic gradient flow. We explicitly characterise the solution chosen by the stochastic flow and prove that it always enjoys better generalisation properties than that of gradient flow. Quite surprisingly, we show that the convergence speed of the training loss controls the magnitude of the biasing effect: the slower the convergence, the better the bias. To fully complete our analysis, we provide convergence guarantees for the dynamics. We also give experimental results which support our theoretical claims. Our findings highlight the fact that structured noise can induce better generalisation and they help explain the greater performances observed in practice of stochastic gradient descent over gradient descent.

研究の動機と目的

  • 過パラメータ化された設定において、明示的な正則化なしに、なぜ確率的勾配降下法(SGD)が勾配降下法(GD)よりも一般化性能に優れているのかを理解すること。
  • 深層ネットワークの主要な性質を捉えた簡略化されたモデルとしての対角線形ネットワークにおける、確率的勾配フロー(SGF)の暗黙的バイアスを同定すること。
  • SGFが、明示的な正則化なしに、GFよりも一般化性能が優れた解に収束することを確立すること。
  • 訓練損失の収束速度が、stochasticityによって誘発される暗黙的バイアスの強度にどのように関連するかを定量化すること。
  • 連続時間枠組みにおいて、SGFの動的挙動がゼロ損失解へ高確率収束することを保証すること。

提案手法

  • SGDをその連続時間版、すなわち確率的勾配フロー(SGF)としてモデル化し、伊藤積分を用いてstochasticな動的挙動を捉える。
  • 損失関数の形状に基づくポテンシャル関数を用いた、時間に依存するstochasticミラー降下としての動的挙動を分析する。
  • 伊藤積分を用いて、stochasticプロセスの正確な表現を導出し、マーチング代数の二次変動を算出する。
  • 集中不等式(例えば、Dubins-Schwarzの不等式およびDoobの最大不等式)を用いて、stochasticなずれ項をバインドする。
  • Lambert W関数および対数不等式を用いて、解の軌道および収束速度の上界を導出する。
  • データおよび初期化に関する弱い仮定のもとで、反復値がゼロ損失解へ高確率収束することを証明する。

実験結果

リサーチクエスチョン

  • RQ1対角線形ネットワークにおいて、SGDの暗黙的バイアスはGDとは異なるか?
  • RQ2SGDにおけるstochasticityは、一般化最適解の選択にどのように影響するか?
  • RQ3訓練損失の収束速度は、SGFにおける暗黙的バイアスの強度と関連づけられるか?
  • RQ4i.i.d.ノイズとは異なり、構造的ノイズがSGFの解の軌道に与える役割は何か?
  • RQ5この設定において、SGFがゼロ損失解へ高確率収束することを厳密に確立できるか?

主な発見

  • 確率的勾配フロー(SGF)は、高確率でゼロ損失解に収束し、これは勾配フロー(GF)が選択する解よりも一般化性能が優れている。
  • SGFにおける暗黙的バイアスの大きさは、収束速度と逆相関する:収束が遅いほど、一般化性能が優れた解へのバイアスが強くなる。
  • SGFの暗黙的バイアスは、証明可能な利点を有しており、解の軌道にスパース化効果を示し、スパース回帰タスクにおいてGDを1桁以上上回る性能を示す。
  • データおよび初期化に関する弱い仮定のもとで、構造的ノイズが存在する状況においても、SGFがゼロ損失解へ高確率収束することが確立された。
  • 理論的分析により、stochasticな動的挙動が、時間に依存するstochasticミラー降下に従うことが判明し、ノイズ構造が解の形状に重要な役割を果たすことが明らかになった。
  • 実験結果により、特にスパース初期化下では、SGDがGDよりも顕著に低い検証損失を回復することが確認され、理論的主張が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。