Skip to main content
QUICK REVIEW

[論文レビュー] Finite Depth and Width Corrections to the Neural Tangent Kernel

Boris Hanin, Mihai Nica|arXiv (Cornell University)|Sep 13, 2019
Stochastic Gradient Optimization Techniques参考文献 25被引用数 21
ひとこと要約

本稿は、ReLUネットワークにおけるニューラルタングエントランスカーネル(NTK)の正確な有限深さおよび有限幅補正を導出し、平均および分散が深さ対幅比に指数的にスケーリングすることを示している。主な発見は、無限の過パラメータ化極限においても、NTKは非決定的であり、学習中に変化することであり、これはラージトレーニングの枠組みにおいてデータ依存の特徴抽出を可能にする。

ABSTRACT

We prove the precise scaling, at finite depth and width, for the mean and variance of the neural tangent kernel (NTK) in a randomly initialized ReLU network. The standard deviation is exponential in the ratio of network depth to width. Thus, even in the limit of infinite overparameterization, the NTK is not deterministic if depth and width simultaneously tend to infinity. Moreover, we prove that for such deep and wide networks, the NTK has a non-trivial evolution during training by showing that the mean of its first SGD update is also exponential in the ratio of network depth to width. This is sharp contrast to the regime where depth is fixed and network width is very large. Our results suggest that, unlike relatively shallow and wide networks, deep and wide ReLU networks are capable of learning data-dependent features even in the so-called lazy training regime.

研究の動機と目的

  • 有限深さおよび有限幅のReLUネットワークにおけるニューラルタングエントランスカーネル(NTK)の統計的挙動を理解すること、特に無限幅極限からの逸脱を特定すること。
  • 深さと幅が変化する際のNTKの平均および分散のスケーリングを分析すること、特に両者が無限に近づく連合極限における挙動を対象とすること。
  • ラージトレーニングの枠組みにおいて、NTKが学習中に変化するかどうかを調査すること、特に核の凍結仮定に疑問を呈すること。
  • NTKの一次のSGD更新を定量的に評価し、深さ対幅比に依存することを示すこと。
  • 無限幅理論の予測とは対照的に、深く広いReLUネットワークが、ラージトレーニングにおいてもデータ依存の特徴抽出を実現できることを示すこと。

提案手法

  • 重みおよび活性化相関の図式的展開を用いて、ランダムに初期化された深層ReLUネットワークにおけるNTKの正確な期待値および分散を導出する。
  • パスごとの勾配およびその重なりを段階的に再帰的に分析し、計算グラフ上のパスの和としてNTKをモデル化する。
  • パス図におけるエッジマルチセットおよびループ構造の組み合わせ的数え上げを用いてNTKのモーメントを計算し、四次のコマントμ₄を介して高次積率を組み込む。
  • 層の幅および深さに依存する重み付きパスカウントスキームを導入し、フラクチュエーションの指数的スケーリングを捉える。
  • 大幅極限における漸近的展開を用いて、NTKの主要補正項を分離し、深さ対幅比に依存する項を含む。
  • NTKの一次SGD更新を分析する際、損失関数のネットワークパラメータに関する勾配の期待値を計算し、深さおよび幅に指数的依存することを示す。

実験結果

リサーチクエスチョン

  • RQ1有限深さおよび幅は、ReLUネットワークにおけるNTKの平均および分散にどのように影響するか?
  • RQ2無限深さおよび無限幅の連合極限においても、NTKは決定的であるか、それともフラクチュエーションが持続するか?
  • RQ3深く広いネットワークにおけるNTKの一次SGD更新のスケーリングはどのようになるか?深さおよび幅にどのように依存するか?
  • RQ4無限幅極限においてNTKがおおよそ凍結されているにもかかわらず、深く広いReLUネットワークは、ラージトレーニングの枠組みでデータ依存の特徴抽出を実現できるか?
  • RQ5深さ対幅比は、NTKの統計的挙動および学習中の変化を決定づける役割を果たすか?

主な発見

  • NTKの標準偏差は、ネットワークの深さ対幅比に指数的に依存するため、無限の過パラメータ化極限においてもNTKは確率的であることが示唆される。
  • NTKの一次SGD更新の平均値も深さ対幅比に指数的に依存するため、学習中に非自明な変化が生じることを示している。
  • 深く広いネットワークにおいても、有限幅補正は無視できない。これは、広い幅の極限においても非決定的カーネルが生じることを意味する。
  • NTKの分散および更新量は深さ対幅比に対して指数的に敏感であるため、深く広いネットワークがデータ依存の特徴を学習可能であると示唆される。
  • 固定深さ・大幅の状況とは対照的に、NTKはおおよそ決定的かつ凍結されているが、深く広いネットワークでは顕著なカーネルのばらつきと変化が観察される。
  • 結果として、深く広いReLUネットワークは、ラージトレーニングの枠組みにおいても特徴抽出が可能であることが示され、従来の「純粋にカーネル的である」という見解に疑問を呈する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。