Skip to main content
QUICK REVIEW

[論文レビュー] Implicit bias of gradient descent for mean squared error regression with wide neural networks

Hui Jin, Guido Montúfar|arXiv (Cornell University)|May 4, 2021
Advanced Numerical Analysis Techniques参考文献 44被引用数 9
ひとこと要約

この論文は、平均二乗誤差回帰における広い浅いReLUネットワークにおける勾配降下法を分析し、解が初期化分布の密度で重み付けされた曲率ペナルティを最小化する関数に収束することを示している。1次元回帰では、これにより一様非対称初期化のもとで自然な3次スプライン補間が得られ、多次元設定や他の活性化関数へは空間的に適応する平滑化スプラインと徐々に小さくなる正則化項を用いた一般化が可能である。

ABSTRACT

We investigate gradient descent training of wide neural networks and the corresponding implicit bias in function space. For 1D regression, we show that the solution of training a width-n shallow ReLU network is within n−1/2 of the function which fits the training data and whose difference from initialization has smallest 2-norm of the second derivative weighted by 1/ζ. The curvature penalty function 1/ζ is expressed in terms of the probability distribution that is utilized to initialize the network parameters, and we compute it explicitly for various common initialization procedures. For instance, asymmetric initialization with a uniform distribution yields a constant curvature penalty, and thence the solution function is the natural cubic spline interpolation of the training data. While similar results have been obtained in previous works, our analysis clarifies important details and allows us to obtain significant generalizations. In particular, the result generalizes to multivariate regression and different activation functions. Moreover, we show that the training trajectories are captured by trajectories of spatially adaptive smoothing splines with decreasing regularization strength.

研究の動機と目的

  • 広い浅いReLUネットワークにおける勾配降下法の平均二乗誤差回帰における暗黙のバイアスを理解すること。
  • 幅が大きくなる際の関数空間における極限関数を特徴づけること。
  • 初期化分布が解における曲率ペナルティの形にどのように寄与するかを特定すること。
  • 1次元から多次元回帰および異なる活性化関数へと結果を一般化すること。
  • 訓練軌道と時間変動する正則化を持つ空間的に適応する平滑化スプラインの動的挙動を結びつけること。

提案手法

  • 平均二乗誤差損失を伴う幅nの浅いReLUネットワークにおける勾配降下法を分析する。
  • 初期化密度ζの逆数1/ζを重みとする、2階微分の重み付き2ノルムを最小化する極限解を導出する。
  • 一様非対称初期化などの一般的な初期化手法に対して、曲率ペナルティ1/ζを明示的に計算する。
  • 曲率ペナルティのもとで、解が最適関数からn−1/2の距離内に収束することを確立する。
  • 多次元回帰および1次元でない設定への分析を一般化する。
  • 訓練軌道を正則化強度が時間とともに減少する空間的に適応する平滑化スプラインの進化としてモデル化する。

実験結果

リサーチクエスチョン

  • RQ11次元回帰において、広いReLUネットワークにおける勾配降下法は関数空間でどのように収束するか?
  • RQ2初期化分布は勾配降下法の暗黙のバイアスにどのように寄与するか?
  • RQ3暗黙のバイアスは曲率ペナルティとして特徴づけられるか? その表現は初期化密度によってどのように記述されるか?
  • RQ4この結果は多次元回帰および異なる活性化関数へと拡張可能か?
  • RQ5訓練軌道は、時間変動する正則化を持つ平滑化スプラインのダイナミクスとどのように関係するか?

主な発見

  • 1次元回帰において、幅nの浅いReLUネットワークの解は、1/ζで重み付けされた2階微分の2ノルムを最小化する関数からn−1/2の距離内にある。
  • 一様非対称初期化のもとでは、曲率ペナルティが定数となるため、訓練データの自然な3次スプライン補間が得られる。
  • 一様非対称初期化などのさまざまな初期化手順に対して、曲率ペナルティ1/ζを明示的に計算し、初期化と暗黙のバイアスの関係を明確にした。
  • 分析は多次元回帰へと一般化され、同じ暗黙のバイアス構造を維持する。
  • 訓練軌道は、正則化強度が時間とともに減少する空間的に適応する平滑化スプラインによって捉えられる。
  • 暗黙のバイアスはさまざまな活性化関数に対して頑健であり、1次元から多次元へと拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。