Skip to main content
QUICK REVIEW

[論文レビュー] GLU Variants Improve Transformer

Noam Shazeer|arXiv (Cornell University)|Feb 12, 2020
Parallel Computing and Optimization Techniques参考文献 11被引用数 20
ひとこと要約

この論文は、Transformerのフィードフォワードネットワークにおける標準的なReLUやGELU活性化関数に代わる、新しいゲーテッド線形ユニット(GLU)変種—ReGLU、GEGLU、SwiGLU、およびバイリニア—を提案する。これらの変種は、事前学習および下流NLPタスクにおけるモデル性能を向上させ、GLUE、SuperGLUE、SQuADベンチマーク全体でより低いパープレキシティと高い精度を達成する。特にGEGLUとSwiGLUが最良の結果を示した。

ABSTRACT

Gated Linear Units (arXiv:1612.08083) consist of the component-wise product of two linear projections, one of which is first passed through a sigmoid function. Variations on GLU are possible, using different nonlinear (or even linear) functions in place of sigmoid. We test these variants in the feed-forward sublayers of the Transformer (arXiv:1706.03762) sequence-to-sequence model, and find that some of them yield quality improvements over the typically-used ReLU or GELU activations.

研究の動機と目的

  • 標準的なフィードフォワードネットワーク活性化関数を、新しいGLUベースの変種に置き換えることで、Transformerモデルの性能を向上させること。
  • GLU部品における代替的な非線形関数が、系列対系列モデルにおける表現学習を向上させられるかどうかを調査すること。
  • これらのGLU変種が、事前学習目的および下流の転移学習タスクに与える影響を評価すること。
  • アーキテクチャの変更を通じてモデル品質を向上させつつ、計算コストおよびパラメータ数の効率を維持すること。
  • GLU変種が多様なNLPベンチマーク全体で一貫した向上をもたらすという実証的証拠を提供すること。

提案手法

  • 最初の線形変換が非線形活性化関数(例:シグモイド、ReLU、GELU、Swish)によってゲーティングされ、出力が2番目の線形変換との要素ごとの積算として出力される、GLU変種のファミリーを提案する。
  • 新しいフィードフォワードネットワークコンポーネントを定義:FFN_GLU、FFN_Bilinear、FFN_ReGLU、FFN_GEGLU、FFN_SwiGLU。それぞれがGLU機構で異なる活性化関数を使用する。
  • 元の2重重みFFNと比較して、GLUベースのモデルでは隠れ次元を3072から2048に削減することで、パラメータ数と計算量を一定に保つ。
  • Adafactor最適化法と逆平方根学習率スケジューリングを用いたT5モデルアーキテクチャとトレーニング設定を採用。事前学習中にドロップアウトを適用しないことで性能を向上させる。
  • C4のスパン埋め込み事前学習目的でモデルを評価し、GLUE、SuperGLUE、SQuADの混合タスクで微調整を行う。
  • 事前学習中のログパープレキシティを測定するためにホールドアウト検証セットを用い、下流ベンチマークでの精度スコアを報告する。

実験結果

リサーチクエスチョン

  • RQ1GELU や Swish などの代替活性化関数を用いたGLU変種が、Transformerフィードフォワードネットワークにおいて標準的なReLU や GELU よりも性能を向上させるか?
  • RQ2標準的な2重重みFFNを3重重みのGLUベースアーキテクチャに置き換えることで、計算コストを増加させずにより良い結果が得られるか?
  • RQ3ReGLU、GEGLU、SwiGLU、Bilinearといった異なるGLU変種は、事前学習損失および下流の転移学習性能においてどのように比較されるか?
  • RQ4GLU変種の使用が、GLUE、SuperGLUE、SQuADといった多様なNLPベンチマーク全体で一貫した改善をもたらすか?
  • RQ5理論的説明が提示されていないにもかかわらず、なぜ特定のGLU変種(例:GEGLU や SwiGLU)が優れた性能を発揮するのか?

主な発見

  • GEGLUとSwiGLU変種は、524,288ステップのトレーニングで、それぞれ1.633および1.636の最低のホールドアウトログパープレキシティを達成し、ReLUベースライン(1.677)を上回った。
  • GLUEベンチマークでは、GEGLUが平均スコア86.17を達成し、ReLUベースライン(85.83)および元のT5モデル(84.24)を上回った。
  • SuperGLUEベンチマークでは、SwiGLUが平均スコア86.54を記録し、元のT5モデルの78.56およびReLUベースラインの77.88を上回った。
  • SQuAD v1.1では、ReGLUがEMスコア83.53およびF1スコア91.18を達成し、ReLUベースライン(83.18 EM、90.87 F1)を上回った。
  • バイリニア変種は、2番目に低いパープレキシティ(1.648)と、SuperGLUEで83.65の平均スコアを記録し、非線形性が欠如しているにもかかわらず効果的であることが示された。
  • すべてのGLU変種が複数のベンチマークで一貫した改善を示し、アーキテクチャの変更が一般化および表現学習を向上させることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。