Skip to main content
QUICK REVIEW

[論文レビュー] Neural Tangent Kernel Beyond the Infinite-Width Limit: Effects of Depth and Initialization

Mariia Seleznova, Gitta Kutyniok|arXiv (Cornell University)|Feb 1, 2022
Neural Networks and Applications被引用数 5
ひとこと要約

本稿は、無限幅極限を越えた深く完全接続されたReLUネットワークにおけるニューラルタングェントカーネル(NTK)を調査し、初期化に依存するダイナミクスのため、曇乱的・臨界的(edge-of-chaos)な段階では深さに伴いNTKのばらつきが指数関数的に増大するが、秩序的段階では安定していることを示している。Pooleら(2016)が同定した3つの段階(秩序的、曇乱的、臨界的)において、無限深さ・無限幅極限におけるNTK分散の正確な式を導出し、訓練中におけるNTKの定数性は秩序的段階でのみ可能であることを明らかにしている。

ABSTRACT

Neural Tangent Kernel (NTK) is widely used to analyze overparametrized neural networks due to the famous result by Jacot et al. (2018): in the infinite-width limit, the NTK is deterministic and constant during training. However, this result cannot explain the behavior of deep networks, since it generally does not hold if depth and width tend to infinity simultaneously. In this paper, we study the NTK of fully-connected ReLU networks with depth comparable to width. We prove that the NTK properties depend significantly on the depth-to-width ratio and the distribution of parameters at initialization. In fact, our results indicate the importance of the three phases in the hyperparameter space identified in Poole et al. (2016): ordered, chaotic and the edge of chaos (EOC). We derive exact expressions for the NTK dispersion in the infinite-depth-and-width limit in all three phases and conclude that the NTK variability grows exponentially with depth at the EOC and in the chaotic phase but not in the ordered phase. We also show that the NTK of deep networks may stay constant during training only in the ordered phase and discuss how the structure of the NTK matrix changes during training.

研究の動機と目的

  • 無限幅極限を超えた深さと初期化がNTKに与える影響を理解すること。
  • 深さと幅が同程度のネットワークにおけるNTKの統計的性質、特に訓練中の分散と定数性を分析すること。
  • Pooleら(2016)が同定した3つの段階(秩序的、曇乱的、臨界的(EOC))の文脈において、NTKが訓練中に定数のままである初期化条件を特定すること。
  • Pooleら(2016)が同定した3つの段階すべてにおいて、無限深さ・無限幅極限におけるNTK分散の正確な式を導出すること。

提案手法

  • 完全接続ReLUネットワークにおけるNTKの理論的分析を、無限深さと無限幅の同時極限下で実施。
  • 秩序的・曇乱的・臨界的段階の3つにおいて、初期化時のNTK分散(2次のモーメントと1次のモーメントの平方の比)の正確な式を導出。
  • ランダム行列理論と再帰的モーメント伝播を用いて、ネットワークの深さに伴うNTK統計量の進化を特徴づける。
  • ブートストラップリサンプリングを用いて、実験的NTK分散の標準誤差を推定し、理論的予測の信頼性ある統計的妥当性を保証。
  • モンテカルロシミュレーションを用いた実験的結果と理論的NTK分散を、深さ対幅比や初期化パラメータの変動に応じて比較。
  • 勾配ノルムとパラメータ伝播の段階別挙動に基づき、NTKが訓練中に定数のままである条件を同定。

実験結果

リサーチクエスチョン

  • RQ1深く完全接続されたReLUネットワークにおいて、深さと幅が同時に無限大に近づくとき、ニューラルタングェントカーネル(NTK)はどのように振る舞うか?
  • RQ2深さ対幅比と初期化ハイパーパrameterが、訓練中のNTKのばらつきと定数性を決定づける役割を果たすか?
  • RQ3秩序的・曇乱的・臨界的(EOC)の3つの段階のうち、どの段階でNTKが訓練中に定数のままであるか、そしてその理由は何か?
  • RQ43つの段階すべてにおいて、初期化時のNTK分散は深さにどのように依存するか?
  • RQ5無限幅極限が、特にNTKの安定性の観点から、深層ネットワークの真の挙動をどれほど正しく捉えていないか、その程度はどの程度か?

主な発見

  • 曇乱的段階および臨界的(EOC)段階では、NTK分散が深さに伴い指数関数的に増大し、訓練中のNTKのばらつきが顕著であることが示された。
  • 秩序的段階では、勾配ノルムが深さとともに減少することで安定化し、NTKが訓練中に定数のままである。
  • 無限深さ・無限幅極限におけるNTK分散は解析的に導出され、段階に依存する性質を示し、3つの段階で異なるスケーリング挙動を示した。
  • 実験的結果は、NTK分散が理論的予測と一致しており、ブートストラップ推定による連続的な誤差バーが、研究結果の頑健性を裏付けた。
  • 深層ネットワークのNTKは、訓練中に定数のままであるのは秩序的段階に限られ、曇乱的段階およびEOC段階では、パラメータ感度の増大に伴い、NTKが顕著に変化することがわかった。
  • 曇乱的段階およびEOC段階では、訓練中にNTK行列の構造が顕著に変化し、非対角成分が対角成分に対して相対的に増大することで、強いサンプル間相互作用が生じていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。