[論文レビュー] Implicit Bias of Gradient Descent for Mean Squared Error Regression with Two-Layer Wide Neural Networks
本稿は、幅広い2層ReLUネットワークにおける勾配降下法が、平均二乗誤差回帰において滑らかな関数への暗黙的バイアスを示すことを確立している。解は補間スプラインに非常に近い近似を達成する。1変数回帰の場合、解は2階微分の曲率加重2ノルムを最小化する関数に収束し、重みは初期化分布に依存する。一様初期化では自然立方スプラインが得られ、多次元の場合には多項スプラインが得られる。
We investigate gradient descent training of wide neural networks and the corresponding implicit bias in function space. For univariate regression, we show that the solution of training a width-$n$ shallow ReLU network is within $n^{- 1/2}$ of the function which fits the training data and whose difference from the initial function has the smallest 2-norm of the second derivative weighted by a curvature penalty that depends on the probability distribution that is used to initialize the network parameters. We compute the curvature penalty function explicitly for various common initialization procedures. For instance, asymmetric initialization with a uniform distribution yields a constant curvature penalty, and thence the solution function is the natural cubic spline interpolation of the training data. \hj{For stochastic gradient descent we obtain the same implicit bias result.} We obtain a similar result for different activation functions. For multivariate regression we show an analogous result, whereby the second derivative is replaced by the Radon transform of a fractional Laplacian. For initialization schemes that yield a constant penalty function, the solutions are polyharmonic splines. Moreover, we show that the training trajectories are captured by trajectories of smoothing splines with decreasing regularization strength.
研究の動機と目的
- 過パラメータ化された2層ReLUネットワークにおける勾配降下法の暗黙的バイアスを、平均二乗誤差回帰の文脈で特徴づけること。
- 最適化軌道と最終解が、正則化強度を減少させる滑らかさのスプラインモデルにどのように関連するかを明らかにすること。
- 初期化分布に基づいた関数空間における曲率ペナルティの明示的表現を導出すること。
- 分数ラプラシアンとラドン変換を用いて、1変数から多次元回帰への分析を拡張すること。
- 確率的勾配降下法が、標準勾配降下法と同一の暗黙的バイアスを示すかどうかを示すこと。
提案手法
- 広大なネットワークの線形化された訓練ダイナミクスを用いて、カーネル領域における勾配フローのダイナミクスを分析する。
- 関数空間における変分問題を導出し、暗黙的バイアスを2階微分(多次元では分数ラプラシアン)の加重2ノルムを最小化することとして特徴づける。
- 解を正則化強度が時間とともに減少する滑らかさのスプラインとして表現し、訓練軌道と関連付ける。
- 一様初期化や非対称初期化などの一般的な初期化スキームについて、曲率ペナルティ関数を明示的に計算する。
- ニューラル接線カーネル(NTK)フレームワークを用いて、パラメータ空間の最適化と関数空間の補間を関連付ける。
- カーネルリッジ回帰とスプライン理論の結果を応用し、ネットワーク幅が増大し、訓練が進行するにつれて補間スプラインに収束することを示す。
実験結果
リサーチクエスチョン
- RQ1勾配降下法は、平均二乗誤差損失で訓練される広大な2層ReLUネットワークにおいて、解をどのようにバイアスするか?
- RQ21変数回帰における暗黙的バイアスの関数的形は何か? また、初期化分布にどのように依存するか?
- RQ3多次元回帰への暗黙的バイアスはどのように一般化されるか? また、分数ラプラシアンはどのような役割を果たすか?
- RQ4訓練軌道は、正則化強度が減少する滑らかさのスプラインの系列として記述可能か?
- RQ5確率的勾配降下法は、この設定において、標準勾配降下法と同一の暗黙的バイアスを示すか?
主な発見
- 1変数回帰において、訓練された関数は、初期化分布に依存する曲率ペナルティで加重された2階微分の2ノルムを最小化する補間関数から $ n^{-1/2} $ の距離に位置する。
- 一様初期化の下では、曲率ペナルティは定数であり、解は訓練データの自然立方スプライン補間に収束する。
- 多次元回帰においては、暗黙的バイアスは分数ラプラシアンのラドン変換によって支配され、ペナルティが定数のとき、解は多項スプラインに対応する。
- 勾配降下法の訓練軌道は、正則化強度が減少する滑らかさのスプラインの系列によって良好に近似される。
- 確率的勾配降下法は、標準勾配降下法と同一の暗黙的バイアスを示し、最適化手法の変種に対して堅牢であることが確認された。
- 結果は他の活性化関数へも拡張可能であり、カーネル領域が成立する限り、最適化手順の選択に強く依存しない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。