Skip to main content
QUICK REVIEW

[論文レビュー] The Influence of Learning Rule on Representation Dynamics in Wide Neural Networks

Blake Bordelon, Cengiz Pehlevan|arXiv (Cornell University)|Oct 5, 2022
Neural Networks and Applications被引用数 7
ひとこと要約

本稿は、勾配降下(GD)、フィードバックアライメント(FA)、直接フィードバックアライメント(DFA)、ヘブ学習、およびゲート付き線形ネットワーク(GLN)といった異なる学習ルールが、無限幅の深層ニューラルネットワークにおける表現ダイナミクスにどのように影響を与えるかを分析している。動的平均場理論(DMFT)フレームワークを用いて、各ルールが時間変化する有効ニューラルタングェントカーネル(eNTK)を誘導することを示しており、FAおよびDFAが豊富な領域(rich regime)において深さ依存の進化する特徴抽出を可能にしているのに対し、ヘブおよびGLNは限定的またはタスク関連の特徴適応を示さないことが明らかになった。

ABSTRACT

It is unclear how changing the learning rule of a deep neural network alters its learning dynamics and representations. To gain insight into the relationship between learned features, function approximation, and the learning rule, we analyze infinite-width deep networks trained with gradient descent (GD) and biologically-plausible alternatives including feedback alignment (FA), direct feedback alignment (DFA), and error modulated Hebbian learning (Hebb), as well as gated linear networks (GLN). We show that, for each of these learning rules, the evolution of the output function at infinite width is governed by a time varying effective neural tangent kernel (eNTK). In the lazy training limit, this eNTK is static and does not evolve, while in the rich mean-field regime this kernel's evolution can be determined self-consistently with dynamical mean field theory (DMFT). This DMFT enables comparisons of the feature and prediction dynamics induced by each of these learning rules. In the lazy limit, we find that DFA and Hebb can only learn using the last layer features, while full FA can utilize earlier layers with a scale determined by the initial correlation between feedforward and feedback weight matrices. In the rich regime, DFA and FA utilize a temporally evolving and depth-dependent NTK. Counterintuitively, we find that FA networks trained in the rich regime exhibit more feature learning if initialized with smaller correlation between the forward and backward pass weights. GLNs admit a very simple formula for their lazy limit kernel and preserve conditional Gaussianity of their preactivations under gating functions. Error modulated Hebb rules show very small task-relevant alignment of their kernels and perform most task relevant learning in the last layer.

研究の動機と目的

  • 代替的学習ルール(生物学的に現実的かどうかに関わらず)が深層ニューラルネットワークにおける表現ダイナミクスおよび機能的インダクティブバイアスに与える影響を理解すること。
  • 学習ルールが無限幅ネットワークにおける特徴および予測ダイナミクスに与える影響を、特にラージ(lazy)および豊富(feature-learning)な領域で分析すること。
  • さまざまな学習ルールに対して時間変化する有効ニューラルタングェントカーネル(eNTK)を特徴付ける動的平均場理論(DMFT)フレームワークを構築すること。
  • FA、DFA、ヘブ、およびGLNネットワークの表現学習能力を比較し、特に深さ依存の特徴適応および勾配・擬似勾配のアライメントに関する理解を深めること。
  • FAおよびDFAにおける初期フィードバック重みの相関の役割を調査し、豊富な領域における表現進化に与える影響を解明すること。

提案手法

  • 時間変化する有効ニューラルタングェントカーネル(eNTK)を用いた、無限幅ネットワークにおける学習ルールダイナミクスの一般枠組みを導出する。
  • 動的平均場理論(DMFT)を適用して、各学習ルールのeNTKを計算し、カーネルの進化を解析的および数値的に研究可能にする。
  • フィードフォワードとフィードバック重みの間の部分的な相関を許容する一般化されたFAルールを導入し、eNTKを制御的に変化させることを可能にする。
  • 無限幅極限における鞍点法および摂動論を用いて、カーネルのフラクチュエーションおよび共分散構造(例:ΦℓおよびGℓの分散が1/Nに比例することを示す)を計算する。
  • 深層線形ネットワークに対してeNTKの閉形式解を導出し、非線形ネットワークに対してはDMFT形式を用いた数値的手順を構築する。
  • 層および幅にわたるカーネルフラクチュエーションと分散スケーリングの実験的妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1学習ルールの選択(例:GD、FA、DFA、ヘブ、GLN)が、広いニューラルネットワークにおける有効ニューラルタングェントカーネル(eNTK)の進化にどのように影響を与えるか?
  • RQ2フィードバックアライメント(FA)および直接フィードバックアライメント(DFA)における前向きおよび後向き重みの初期相関が、豊富な領域における表現学習に果たす役割は何か?
  • RQ3異なる学習ルールは、特に豊富(非ラージ)な学習領域において、複数の層にわたる特徴学習能力においてどのように比較されるか?
  • RQ4ヘブ学習およびゲート付き線形ネットワーク(GLN)は、勾配降下と比較して、タスク関連の特徴適応をどの程度示すか?
  • RQ5豊富な領域における動的eNTKは、勾配・擬似勾配のアライメントおよびネットワークの機能的インダクティブバイアスとどのように関係しているか?

主な発見

  • ラージ領域では、DFAおよびヘブは最後の層の特徴のみを学習可能であるが、完全なFAは初期のフィードフォワードとフィードバック重みの相関が非ゼロであれば、より前の層も活用できる。
  • 豊富な領域では、FAおよびDFAの両方が時間的に変化し、深さに依存するeNTKを示し、ラージ限界と比較してより深い特徴適応が可能になる。
  • 直感に反して、豊富な領域におけるFAネットワークは、前向きおよび後向き重みの初期相関が小さい場合に、より顕著な特徴学習を示す。
  • GLNネットワークは、前活性化の条件付きガウス性を保持し、ラージ極限におけるeNTKに対して単純な閉形式表現を有し、そのダイナミクスはGDと同等のものである。
  • ヘブ学習は最小限のタスク関連のカーネルアライメントを示し、学習の大部分が最後の層で行われるため、深さにわたる特徴適応が限定的である。
  • DMFTフレームワークは、カーネル分散が1/Nに比例することを予測しており、Φℓの分散は層の深さとともに増加し、Gℓの分散は深さとともに減少する。この予測は実験的に確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。