Skip to main content
QUICK REVIEW

[論文レビュー] Towards Understanding the Condensation of Neural Networks at Initial Training

Hanxu Zhou, Zhou, Qixuan|arXiv (Cornell University)|May 25, 2021
Neural Networks and Applications参考文献 24被引用数 8
ひとこと要約

この論文は、小さな初期化が過パラメータ化されたReLUニューラルネットワークの初期学習段階で重みの凝縮を引き起こすメカニズムを調査し、入力重みの凝縮された方向の最大数が、活性化関数のゼロにおける重複度の2倍であることを示している。理論的分析により、重複度1の活性化関数(例:ReLU、GELU)および任意の重複度をもつ1次元入力に対してこれが確認され、活性化関数の滑らかさと凝縮によるimplicit regularizationの根本的な関連が明らかになった。

ABSTRACT

Empirical works show that for ReLU neural networks (NNs) with small initialization, input weights of hidden neurons (the input weight of a hidden neuron consists of the weight from its input layer to the hidden neuron and its bias term) condense on isolated orientations. The condensation dynamics implies that the training implicitly regularizes a NN towards one with a much smaller effective size. In this work, we illustrate the formation of the condensation in multi-layer fully connected NNs and show that the maximal number of condensed orientations in the initial training stage is twice the multiplicity of the activation function, where "multiplicity" indicates the multiple roots of activation function at origin. Our theoretical analysis confirms experiments for two cases, one is for the activation function of multiplicity one with arbitrary dimension input, which contains many common activation functions, and the other is for the layer with one-dimensional input and arbitrary multiplicity. This work makes a step towards understanding how small initialization leads NNs to condensation at the initial training stage.

研究の動機と目的

  • 過パラメータ化されたニューラルネットワークにおける小さな初期化のもとでの初期学習段階における入力重みの凝縮メカニズムを理解すること。
  • 活性化関数のゼロにおける重複度と凝縮された重み方向の最大数との関係を特定すること。
  • 多層全結合ネットワークにおける凝縮の経験的観察を理論的に裏付けること。
  • 2層ReLUネットワークに関する先行研究を一般化された活性化関数およびより深いアーキテクチャへと拡張すること。

提案手法

  • 理論的分析を2つのケースについて実施:(1) 任意の入力次元をもつ重複度1の活性化関数、(2) 任意の重複度をもつ1次元入力。
  • 初期学習段階における入力重みのダイナミクスに着目し、凝縮がどのように孤立した方向に重みが整列するかを分析する。
  • 活性化関数のゼロにおける重複度は、微分係数がすべて0となる最大の次数であり、p階微分で初めて非ゼロとなるものとして定義される。
  • 様々な活性化関数(例:ReLU、GELU、x²tanh(x))を用いた多層全結合ネットワークで実験を行い、理論的予測の妥当性を検証する。
  • 隠れ層のニューロン間の入力重みベクトルのなす角度距離を用いて、凝縮された方向の数を定量化する。
  • 学習は小さなガウス初期化、Adam最適化法、交差エントロピー損失またはMSE損失を用い、MNIST、CIFAR100、および合成的な低周波/高周波関数のデータを用いる。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークの初期学習段階における凝縮された入力重み方向の最大数は、何によって決定されるか?
  • RQ2活性化関数のゼロにおける重複度は、凝縮ダイナミクスにどのように影響するか?
  • RQ32層ReLUネットワークを超えた多層全結合ネットワークにおける凝縮現象を説明する理論的枠組みは構築可能か?
  • RQ4ターゲット関数の複雑さは、凝縮された方向の数に影響を与えるか?

主な発見

  • 初期学習段階における凝縮された入力重み方向の最大数は、活性化関数のゼロにおける重複度の2倍である。
  • 重複度1の活性化関数(例:ReLU、GELU、シグモイド)では、入力次元にかかわらず、凝縮された方向の最大数は2つである。
  • 1次元入力設定では、凝縮された方向の数が重複度の2倍に一致し、理論的予測が裏付けられた。
  • 経験的結果から、低周波のターゲット関数(例:MNIST、CIFAR100)では凝縮された方向が少なく、ネットワークが低複雑度の関数を学習していることと整合的である。
  • 凝縮ダイナミクスはネットワークをより単純な状態にリセットし、学習過程で単純な表現から複雑な表現へと段階的に進化するメカニズムを可能にする。
  • 理論的分析により、小さな初期化のもとで凝縮が自然に生じることを確認し、活性化関数の滑らかさとimplicit regularizationとの関連が明確になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。