[論文レビュー] How Implicit Regularization of ReLU Neural Networks Characterizes the Learned Function -- Part I: the 1-D Case of Two Layers with Random First Layer
この論文は、最初の層の重みをランダムに設定し、第二の層の重みを学習する2層のReLUニューラルネットワークが、ℓ²正則化のもとで、学習された関数を暗黙的に正則化することを確立している。その結果、無限大の幅における隠れユニット数の極限で、滑らかなスプライン補間へ収束する。最小二乗回帰において、早期停止を施した勾配降下法は、滑らかさスプライン回帰に対応し、最適化における暗黙のバイアスと関数空間における古典的正則化の間の深い関係を明らかにする。
In this paper, we consider one dimensional (shallow) ReLU neural networks in which weights are chosen randomly and only the terminal layer is trained. First, we mathematically show that for such networks L2-regularized regression corresponds in function space to regularizing the estimate's second derivative for fairly general loss functionals. For least squares regression, we show that the trained network converges to the smooth spline interpolation of the training data as the number of hidden nodes tends to infinity. Moreover, we derive a novel correspondence between the early stopped gradient descent (without any explicit regularization of the weights) and the smoothing spline regression.
研究の動機と目的
- ランダムな最初の層の重みを持つ浅いReLUネットワークの学習が引き起こす暗黙の正則化を理解すること。
- このようなネットワークにおけるℓ²正則化回帰によって学習される関数を特徴づけること。
- 無限大の幅における極限において、早期停止勾配降下法と滑らかさスプライン回帰の間の対応関係を確立すること。
- 最初の層の重みが訓練済みモデルの誘導的バイアスをどのように形作るかを明確にすること。
- 広大でランダム化されたReLUネットワークの一般化および最適化挙動のための厳密な理論的基盤を提供すること。
提案手法
- 最初の層の重みをランダムに設定し、第二の層の重みを学習可能な2層のReLUネットワークを分析する。
- 無限大の隠れユニット数の極限をとることで、平均場型の解析を用いて巨視的挙動を導出する。
- 関数解析と弱微分を用いて、学習された関数の2階微分を特徴づける。
- 第二の層の重みの正則化と、L²空間における関数の2階微分の間の対応関係を確立する。
- 新しい正則化汎関数を用いて、早期停止勾配降下法と滑らかさスプライン回帰の間の同値性を導出する。
- スキップ接続あり・なしの両方の適応回帰スプラインを用いて、学習された関数をモデル化し、正則化効果を比較する。
実験結果
リサーチクエスチョン
- RQ1ℓ²正則化付きの2層ReLUネットワークを、最初の層の重みをランダムに設定して学習した場合、関数空間における学習された関数はどのように正則化されるか?
- RQ2隠れユニット数が無限大に近づく際、このようなネットワークが収束する関数クラスは何か?
- RQ3このようなネットワークにおける早期停止勾配降下法は、古典的な滑らかさスプライン回帰とどのように関係しているか?
- RQ4最初の層の重みの分布が、モデルの暗黙のバイアスを形作る上で果たす役割は何か?
- RQ5最初の層の重み分布から導かれる特定の正則化項を備えたスプラインとして、学習された関数を特徴づけることができるか?
主な発見
- ℓ²正則化回帰において、訓練済みネットワークは隠れユニット数が無限大に近づくにつれて、訓練データの滑らかなスプライン補間へ収束する。
- このようなネットワークにおける早期停止勾配降下法は、滑らかさスプライン回帰に正確に対応しており、最適化ダイナミクスと古典的正則化の間の直接的な関係を確立する。
- 学習された関数の2階微分は、最初の層の重み分布に依存する方法で正則化され、特に重み分布の尾部における積分を通じて現れる。
- 最初の層の重み分布が重い尾を持つ場合(例えば、大きな区間上で一様分布)、線形項および絶対値項の係数に対する正則化が無視可能になり、スキップ接続の有無に関わらず、ほぼ同一の挙動を示すようになる。
- 最適化問題の解は、訓練損失と、最初の層の重み密度から導かれる重み付きL²ノルムの2階微分を組み合わせた汎関数の最小化と等価である。
- 最初の層の重み分布の尾がますます重くなる極限において、適応回帰スプラインは、スキップ接続の有無に関わらず、W¹,∞で古典的滑らかさスプラインに一様に収束する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。