[論文レビュー] Limitations of Lazy Training of Two-layers Neural Networks
本稿は、2層ReLUニューラルネットワークにおけるラージトレーニングの限界を、2次活性化関数を用いて調査し、ランダム特徴量(RF)、ニューラルタングェント(NT)、および完全に訓練された(NN)領域を比較する。入力次元より少ないニューロン数の場合、単純な2次関数に対しても、RFおよびNT領域における一般化リスクは完全トレーニングに比べて無限に悪化しうることを証明しており、低過パラメータ化下でのラージトレーニング性能における根本的なギャップを浮き彫りにしている。
We study the supervised learning problem under either of the following two models: (1) Feature vectors ${\boldsymbol x}_i$ are $d$-dimensional Gaussians and responses are $y_i = f_*({\boldsymbol x}_i)$ for $f_*$ an unknown quadratic function; (2) Feature vectors ${\boldsymbol x}_i$ are distributed as a mixture of two $d$-dimensional centered Gaussians, and $y_i$'s are the corresponding class labels. We use two-layers neural networks with quadratic activations, and compare three different learning regimes: the random features (RF) regime in which we only train the second-layer weights; the neural tangent (NT) regime in which we train a linearization of the neural network around its initialization; the fully trained neural network (NN) regime in which we train all the weights in the network. We prove that, even for the simple quadratic model of point (1), there is a potentially unbounded gap between the prediction risk achieved in these three training regimes, when the number of neurons is smaller than the ambient dimension. When the number of neurons is larger than the number of dimensions, the problem is significantly easier and both NT and NN learning achieve zero risk.
研究の動機と目的
- 2層ニューラルネットワークの一般化性能を、ランダム特徴量(RF)、ニューラルタングェント(NT)、および完全に訓練された(NN)の3つのトレーニング領域で分析すること。
- ラージトレーニング(NT)およびランダム特徴量(RF)が、完全なネットワークトレーニングを必要とする関数を、特に低過パラメータ化設定下で効率的に近似できるかどうかを調査すること。
- NTおよびRF領域が、2次関数のような単純なターゲット関数ですら最適リスクに到達できない条件を同定すること。
- 特にニューロン数が入力次元より小さい場合に、3つの領域間の予測リスクギャップに理論的バウンディングを確立すること。
提案手法
- 2つの教師あり学習問題を分析:(1) ガウス特徴量と2次ターゲット関数を用いた回帰、(2) 混合ガウス特徴量とクラスラベルを用いた2値分類。
- 3つのトレーニング領域を比較:RF(2層目重みのみトレーニング)、NT(初期化周辺の線形化)、NN(すべての重みトレーニング)、2次活性化関数を用いる。
- 関数解析および行列最適化を用いて、各領域における予測リスクの正確な式を導出。特に、カーネル行列のフロベニウスノルムとトレースに注目する。
- ターゲット関数のヘッセ行列とデータ共分散行列の固有分解を用いて、最適なネットワーク重みを特徴付け、リスクを最小化する。
- コーシー・シュワルツの不等式を適用してNN領域におけるリスクをバウンディングし、最適解をターゲット行列の上位-r特異部分空間への射影として導出する。
- 完全に訓練されたNN領域における最適リスクは、ターゲット行列Δの最大r個の特異値の二乗和によって決定されることを確立する。
実験結果
リサーチクエスチョン
- RQ1単純な2次ターゲット関数に対し、ランダム特徴量(RF)およびニューラルタングェント(NT)領域が完全に訓練されたネットワーク(NN)と同等の一般化リスクを達成できるか?
- RQ2ニューロン数が入力次元より小さい場合、RF、NT、およびNN領域間の予測リスクの根本的ギャップは何か?
- RQ3ラージトレーニングが、完全に訓練された2層ネットワークの表現力を捉えきれない条件は何か?
- RQ4ニューロン数と入力次元の関係が、3つのトレーニング領域におけるリスクにどのように影響するか?
- RQ52層ReLUネットワークにおける2次活性化関数を用いた場合、ラージトレーニングと完全トレーニングの間で、証明可能な(場合に応じて無限大に達する)性能ギャップが存在するか?
主な発見
- ニューロン数が入力次元より小さい場合、RFおよびNT領域における予測リスクは、完全に訓練されたNN領域に比べて無限に悪化しうる。これは、単純な2次関数に対しても同様に成立する。
- 同じ2次ターゲット関数に対して、ニューロン数が入力次元より小さい場合、NT領域におけるリスクはゼロから離れており、一方NN領域ではニューロン数が次元を超えるとリスクがゼロに達する。
- ニューロン数が入力次元を超える場合、NTおよびNN領域の両方がゼロの予測リスクを達成する。これは、過パラメータ化がラージトレーニングと完全トレーニングのギャップを埋めるということを示している。
- NN領域における最適リスクは、ターゲット行列Δの最大r個の特異値の二乗和によって決定され、ここでrはニューロン数と入力次元の最小値である。
- ニューロン数が少ない場合、RFおよびNT領域は、固定された1層目重みと線形化された性質により、2次関数を表現する能力に根本的に制限されている。
- 本稿は、完全トレーニングとラージトレーニングの表現力の理論的分離を確立し、ラージトレーニングが常に完全に訓練されたネットワークで簡単に表現可能な関数を効率的に近似できるわけではないことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。