Skip to main content
QUICK REVIEW

[論文レビュー] Phase diagram for two-layer ReLU neural networks at infinite-width limit

Tao Luo, Zhi‐Qin John Xu|arXiv (Cornell University)|Jul 15, 2020
Model Reduction and Neural Networks参考文献 15被引用数 15
ひとこと要約

本稿は、無限幅極限における2層ReLUニューラルネットワークのフェーズ図を提示し、訓練中の入力重みの相対的変化に基づいて、線形、臨界、凝縮の3つの明確な力学的状態を同定する。主な貢献は、ハイパーパramータスケーリング(γおよびγ′を介して)をこれらの状態にマッピングする理論的かつ実験的フレームワークを提供することであり、初期化と幅が訓練ダイナミクスおよび暗黙の正則化に与える影響を明らかにする。

ABSTRACT

How neural network behaves during the training over different choices of hyperparameters is an important question in the study of neural networks. In this work, inspired by the phase diagram in statistical mechanics, we draw the phase diagram for the two-layer ReLU neural network at the infinite-width limit for a complete characterization of its dynamical regimes and their dependence on hyperparameters related to initialization. Through both experimental and theoretical approaches, we identify three regimes in the phase diagram, i.e., linear regime, critical regime and condensed regime, based on the relative change of input weights as the width approaches infinity, which tends to $0$, $O(1)$ and $+\infty$, respectively. In the linear regime, NN training dynamics is approximately linear similar to a random feature model with an exponential loss decay. In the condensed regime, we demonstrate through experiments that active neurons are condensed at several discrete orientations. The critical regime serves as the boundary between above two regimes, which exhibits an intermediate nonlinear behavior with the mean-field model as a typical example. Overall, our phase diagram for the two-layer ReLU NN serves as a map for the future studies and is a first step towards a more systematical investigation of the training behavior and the implicit regularization of NNs of different structures.

研究の動機と目的

  • 訓練中に変化するハイパーパramータースケーリングの下での2層ReLUニューラルネットワークの力学的挙動を特徴づけること。
  • 幅が無限大に近づく際の入力重みの相対的変化に基づいて、線形、臨界、凝縮の明確な訓練状態を同定すること。
  • 初期化分散とネットワーク幅から導かれるスケーリングパラメータγとγ′を用いてフェーズ図を構築すること。
  • 広いニューラルネットワークにおける暗黙の正則化と訓練ダイナミクスを理解するための理論的・実験的基盤を提供すること。
  • 今後の深層ネットワークの訓練行動および一般化特性に関する研究の基盤となる地図を提供すること。

提案手法

  • 幅m → ∞の際の初期化分散β₁, β₂およびスケーリング係数αの漸近的挙動から、2つの主要なスケーリングパラメータγとγ′を導出する。
  • 適切な再スケーリングの下で勾配フローのダイナミクスを用い、異なるネットワーク幅間での力学的類似性を達成する。
  • 理論的分析と数値実験を用いて、3つの力学的状態(線形:w_kの相対的変化 → 0、臨界:O(1)の変化、凝縮:∞への変化)の境界を同定する。
  • 線形状態の妥当性を確認するためのランダム特徴量モデルと、臨界状態の妥当性を確認するための平均場理論近似を適用する。
  • 集中不等式と高確率的バインディングを用いて、特定のγおよびγ′の条件下で大きなパラメータシフトが生じる可能性を確立する。
  • 1次元データセットにおける実証的分析を通しフェーズ図を検証し、γおよびγ′に沿ったパラメータのずれのトレンドを可視化する。

実験結果

リサーチクエスチョン

  • RQ1幅mに対するハイパーパramータースケーリング(α, β₁, β₂)の違いが、2層ReLUネットワークの訓練ダイナミクスにどのように影響するか?
  • RQ2無限幅極限における明確な力学的状態とは何か? そして、入力重みの相対的変化によってどのように特徴づけられるか?
  • RQ3ハイパーパラメータの選択を訓練行動と暗黙の正則化にマッピングする統一されたフェーズ図を構築できるか?
  • RQ4スケーリングパラメータγとγ′が、訓練ダイナミクスが線形、臨界、または凝縮のいずれであるかを決定する役割を果たすか?
  • RQ5初期化分散比とスケーリング係数は、特徴空間におけるパラメータの凝縮の発生にどのように影響するか?

主な発見

  • フェーズ図は、入力重みの漸近的挙動に基づき、3つの状態を同定する:線形(w_kの相対的変化 → 0)、臨界(O(1)の変化)、凝縮(相対的変化 → ∞)。
  • 臨界状態は線形状態と凝縮状態の境界として機能し、平均場ダイナミクスが典型的な例として含まれる。
  • 凝縮状態では、実験により特徴空間において複数の離散的向きに、活性化されたニューロンが凝縮することが観察された。
  • γ′ < γ − 1のとき、sup_t RD(θ_w(t)) ≫ 1 が成り立ち、特定のスケーリング条件下で強いパラメータシフトが生じることを示す。
  • 理論的分析により、初期化に関して高確率で、mが大きくかつγ′ < γ − 1のとき、w_kの相対的変化が任意の定数を超えることが確認され、凝縮状態が裏付けられた。
  • フェーズ図は、初期化とスケーリングパラメータの幅mに対する対数スケーリングから導かれる2つの独立した座標γとγ′を用いて構築された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。