Skip to main content
QUICK REVIEW

[論文レビュー] Parameter Norm Growth During Training of Transformers.

William Merrill, Vivek Ramanujan|arXiv (Cornell University)|Oct 19, 2020
Topic Modeling参考文献 20被引用数 5
ひとこと要約

この論文は、勾配降下法(GD)がトランスフォーマーのパラメータのL2ノルムを訓練中にどのように増大させるかを調査し、高い訓練精度がより大きなノルム増大を可能にすることを示している。このノルム増大がネットワークの飽和を引き起こし、モデル容量を低下させることを明らかにした。これは、T5のようなNLPモデルにとって特に重要である、以前に認識されていなかったGDのインダクティブバイアスを特定した。

ABSTRACT

The capacity of neural networks like the widely adopted transformer is known to be very high. Evidence is emerging that they learn successfully due to inductive bias in the training routine, typically some variant of gradient descent (GD). To better understand this bias, we study the tendency of transformer parameters to grow in magnitude during training. We find, both theoretically and empirically, that, in certain contexts, GD increases the parameter $L_2$ norm up to a threshold that itself increases with training-set accuracy. This means increasing training accuracy over time enables the norm to increase. Empirically, we show that the norm grows continuously over pretraining for T5 (Raffel et al., 2019). We show that pretrained T5 approximates a semi-discretized network with activation functions. Such saturated networks are known to have a reduced capacity compared to the original network family that can be described in automata-theoretic terms. This suggests saturation is a new characterization of an inductive bias implicit in GD that is of particular interest for NLP. While our experiments focus on transformers, our theoretical analysis extends to other architectures with similar formal properties, such as feedforward ReLU networks.

研究の動機と目的

  • 勾配降下法がトランスフォーマー学習に導入するインダクティブバイアスを理解すること、特にパラメータノルムダイナミクスを通じて。
  • 高い容量を持つにもかかわらずトランスフォーマーがなぜ一般化するのかを解明することに焦点を当て、訓練ダイナミクスがモデル行動に与える影響を調査すること。
  • 訓練精度の向上と自己注意層およびフィードフォワード層におけるパラメータノルム増大との関係を説明すること。
  • 活性化関数の飽和と関連づけて、ノルム増大がモデル容量に与える影響を特定すること。
  • 理論的知見を、類似した形式的性質を持つ他のアーキテクチャ、例えばReLUフィードフォワードネットワークへと拡張すること。

提案手法

  • トレーニング中にL2ノルムが増大する条件を導出するための勾配降下法ダイナミクスの理論的分析。
  • T5の事前学習中に層ごとにL2ノルム増大を経験的に測定し、訓練ステップと精度レベルに応じた変化を追跡。
  • 活性化関数の区分的定数関数としての性質を持つ半離散化ネットワークとして、事前学習済みT5をモデル化し、飽和効果を検証。
  • 自動機械的形式的枠組みを用いて、飽和ネットワークの容量を元の連続的ネットワーク族と比較。
  • 訓練精度とノルム増大の閾値の関係を分析し、高い精度がより大きなノルムを許容することを示した。
  • 理論的発見をフィードフォワードReLUネットワークへと拡張し、トランスフォーマーに限らない広範な適用可能性を示した。

実験結果

リサーチクエスチョン

  • RQ1勾配降下法は、訓練中にトランスフォーマーのパラメータのL2ノルムにどのように影響を与えるか?
  • RQ2訓練精度と最適化中の最大達成可能なパラメータノルムの関係は何か?
  • RQ3パラメータノルム増大がネットワークの飽和とモデル容量の低下にどの程度寄与するか?
  • RQ4事前学習済みトランスフォーマーの挙動は、飽和活性化関数を持つ半離散化ネットワークとしてモデル化可能か?
  • RQ5このノルム増大現象は、ReLUフィードフォワードネットワークのような類似した構造的性質を持つ他のアーキテクチャにも一般化可能か?

主な発見

  • T5の事前学習中に、トランスフォーマーのパラメータのL2ノルムは連続的に増大し、その増大率と程度は訓練精度と相関していた。
  • 高い訓練精度は、より高い閾値にまでノルムが増大することを可能にし、一般化性能の向上がより大きなノルム値を許容することを示している。
  • 事前学習済みT5は、区分的定数活性化関数を持つ半離散化ネットワークとしての性質を示しており、ノルム増大による飽和が生じていると示唆される。
  • 飽和ネットワークは、元の連続的ネットワークと比較して容量が低下しており、ノルム増大が構造的インダクティブバイアスを引き起こしている可能性がある。
  • 理論的分析により、このノルム増大と飽和効果はトランスフォーマーに特有のものではなく、類似した形式的性質を持つフィードフォワードReLUネットワークに対しても同様に適用可能であることが示された。
  • これらの発見は、勾配降下法がモデルを飽和的・低容量の表現へと暗黙的にバイアスしている可能性を示しており、高いモデル容量にもかかわらず一般化が成立する理由の説明が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。