Skip to main content
QUICK REVIEW

[論文レビュー] The Onset of Variance-Limited Behavior for Networks in the Lazy and Rich Regimes

Alexander Atanasov, Blake Bordelon|arXiv (Cornell University)|Dec 23, 2022
Model Reduction and Neural Networks被引用数 4
ひとこと要約

本稿は、広いニューラルネットワークにおける分散制限一般化の発生時期を特定し、有限幅効果が訓練データサイズ $ P^* \sim \sqrt{N} $ で顕著になることを示している。ここで一般化性能は無限幅性能を下回る。著者らは、これと最終ニューラル接種核(NTK)のゆらぎを関連づけ、特徴学習とアンサンブル平均化が分散を抑制し、臨界 $ P^* $ を超えて一般化性能を向上させることを示している。

ABSTRACT

For small training set sizes $P$, the generalization error of wide neural networks is well-approximated by the error of an infinite width neural network (NN), either in the kernel or mean-field/feature-learning regime. However, after a critical sample size $P^*$, we empirically find the finite-width network generalization becomes worse than that of the infinite width network. In this work, we empirically study the transition from infinite-width behavior to this variance limited regime as a function of sample size $P$ and network width $N$. We find that finite-size effects can become relevant for very small dataset sizes on the order of $P^* \sim \sqrt{N}$ for polynomial regression with ReLU networks. We discuss the source of these effects using an argument based on the variance of the NN's final neural tangent kernel (NTK). This transition can be pushed to larger $P$ by enhancing feature learning or by ensemble averaging the networks. We find that the learning curve for regression with the final NTK is an accurate approximation of the NN learning curve. Using this, we provide a toy model which also exhibits $P^* \sim \sqrt{N}$ scaling and has $P$-dependent benefits from feature learning.

研究の動機と目的

  • 有限幅ニューラルネットワークが無限幅ネットワークより一般化性能が劣り始める臨界の訓練データサイズ $ P^* $ を特定すること。
  • 有限幅一般化誤差を引き起こすニューラル接種核(NTK)の分散の役割を理解すること。
  • 特徴学習とアンサンブル平均化がどのように分散制限行動を緩和するかを調査すること。
  • 最終実測NTK(eNTK f )を用いたカーネル回帰とニューラルネットワークの学習曲線の一致を検証すること。
  • 本物のネットワークで観察された主なスケーリング行動を再現する簡易なランダム特徴モデルを構築すること。

提案手法

  • 幅 $ N $、訓練データサイズ $ P $、出力スケーリング $ \alpha $ を変化させたReLUネットワークを多項式回帰に適用し、ラージとリッチの両領域を調整する。
  • 最終実測NTK(eNTK f )を用いてニューラルネットワークの一般化誤差を近似し、実際の学習曲線と強い一致を示す。
  • ランダム初期化の間での最終NTKの分散を分析し、有限幅ゆらぎを定量化する。
  • モデル平均化とデータオーグメンテーションによるアンサンブル平均化を適用し、分散に起因する誤差を低減する。
  • ノイズを含むランダム特徴モデルを導入し、$ P^* \sim \sqrt{N} $ スケーリングと特徴学習によるアライメント向上を解析的に再現する。
  • 異なるネットワークの深さ、入力次元、センター化手法を比較し、アーキテクチャ的要因を分離する。

実験結果

リサーチクエスチョン

  • RQ1有限幅ニューラルネットワークが無限幅ネットワークより一般化性能が劣り始める訓練データサイズ $ P $ はどの程度か?
  • RQ2最終ニューラル接種核(NTK)の分散がどのように有限幅一般化誤差を引き起こすか?
  • RQ3特徴学習とアンサンブル平均化が有限幅ネットワークにおける分散制限行動をどの程度抑制できるか?
  • RQ4最終実測NTK(eNTK f )を用いたカーネル回帰は、真のニューラルネットワークの学習曲線をどの程度よく近似できるか?
  • RQ5シンプルなランダム特徴モデルは、観察された $ P^* \sim \sqrt{N} $ スケーリングと特徴学習の利点を再現できるか?

主な発見

  • ReLUネットワークが多項式回帰において、有限幅ネットワークが無限幅ネットワークより性能を劣り始める臨界サンプルサイズ $ P^* $ は、$ P^* \sim \sqrt{N} $ に比例する。
  • 有限幅ネットワークの一般化誤差は、特にラージ領域において、ランダム初期化のゆらぎに支配され、これが分散制限領域を定義する。
  • アンサンブル平均化は分散を顕著に低減し、一般化性能を向上させる。特に分散制限領域で顕著である。
  • 特徴学習(小さな出力スケーリング $ \alpha $ または高次多項式タスクによって誘発)は、$ P^* $ の前後で一般化性能を向上させ、主に最終NTKとターゲット関数のアライメントを高めることで実現する。
  • ニューラルネットワークの学習曲線は、最終実測NTK(eNTK f )を用いたカーネル回帰によってよく近似され、eNTK f がネットワーク挙動の代理として有効であることを裏付けている。
  • 簡易ランダム特徴モデルは、$ P^* \sim \sqrt{N} $ スケーリングと特徴学習による利点(アライメント向上)を再現し、観察された現象の背後にあるメカニズムを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。