Skip to main content
QUICK REVIEW

[論文レビュー] DeLighT: Deep and Light-weight Transformer

Sachin Mehta, Marjan Ghazvininejad|arXiv (Cornell University)|Aug 3, 2020
Topic Modeling参考文献 45被引用数 46
ひとこと要約

DeLighTは、グループ線形変換とブロック単位スケーリングを用いたDeLighT変換を利用する深く、パラメータ効率の高いトランスフォーマーであり、従来のトランスフォーマーと同等またはそれ以上の性能を、はるかに少ないパラメータと演算で達成する。

ABSTRACT

We introduce a deep and light-weight transformer, DeLighT, that delivers similar or better performance than standard transformer-based models with significantly fewer parameters. DeLighT more efficiently allocates parameters both (1) within each Transformer block using the DeLighT transformation, a deep and light-weight transformation, and (2) across blocks using block-wise scaling, which allows for shallower and narrower DeLighT blocks near the input and wider and deeper DeLighT blocks near the output. Overall, DeLighT networks are 2.5 to 4 times deeper than standard transformer models and yet have fewer parameters and operations. Experiments on benchmark machine translation and language modeling tasks show that DeLighT matches or improves the performance of baseline Transformers with 2 to 3 times fewer parameters on average. Our source code is available at: \url{https://github.com/sacmehta/delight}

研究の動機と目的

  • パラメータコストの比例関係なしに、深さと幅がスケールするパラメータ効率の高いシーケンスモデルを動機づける。
  • 特徴シャッフルを用いたグループ線形変換を用いるDeLighT変換を提案し、より広い表現を効率的に学習する。
  • 出力近傍のより深く幅広いブロックへ容量を割り当てるブロック単位のスケーリングを導入し、入力ブロックは浅く細く保つ。
  • DeLighTが翻訳と言語モデリングで、ベースラインより少ないパラメータとFLOPsで同等またはそれ以上の性能を達成することを示す。

提案手法

  • N個のGLT層を用いてdm次元の入力を高次元空間に展開し、再び元の次元数に縮小するDeLighT変換を導入する。
  • トランスフォーマーの多頭自己注意とFFNを、単頭自己注意と軽量FFNに置換する。
  • GLTグループ間で情報を共有する特徴シャッフルと、入力ミキサーを用いて訓練を安定化させる。
  • 入力サイズから深さと幅を切り離し、初期ブロックを浅く細く、後半ブロックを深く幅広くするブロック単位スケーリングを実現する。
  • Nmin、Nmax、wmを用いたブロック単位スケーリングを定義し、ネットワーク全体で深さと幅が異なるDeLighTブロックを作成する。
  • do = dm/2が注意コストを約2分の1に、FFNが約16倍削減されることを、軽量設計の結果として示す。

実験結果

リサーチクエスチョン

  • RQ1入力サイズと無関係に幅/深さをデカップリングした深くて軽量なトランスフォーマーは、かなり少ないパラメータでトランスフォーマーのベースラインに匹敵するか、それを上回ることができるか?
  • RQ2ブロック単位スケーリングとDeLighT変換は、均一スケーリングと比べて機械翻訳と言語モデリングタスクでより良いパラメータ活用と成果を生むか?
  • RQ3少ないパラメータとFLOPsで、DeLighTは最先端トランスフォーマーとBLEU・パープレキシティの点でどのように比較されるか?

主な発見

  • DeLighTは、WMTおよびIWSLTデータセットにおいて、ベースラインのTransformersと同等またはより良いBLEUスコアを、パラメータを2.8xから1.8x減らして達成する。
  • DeLighTは標準のトランスフォーマーより2.5–4x深いが、パラメータと演算はより少なく済む。
  • WMT’14 En-Frでは、DeLighTはTransformerベースラインに比べてパラメータが1300万少なく、演算が3B少なく、BLEUを+1.3向上させる。
  • 言語モデリング(WikiText-103)では、DeLighTはTransformer-XLと同等の性能を、パラメータを1.5x減らして達成する。
  • ブロック単位スケーリングは入力近傍にはパラメータを少なく、出力近傍にはより深い容量を割り当て、性能を損なうことなく効率を向上させる。
  • DeLighTはベースラインのトランスフォーマーと比べて正則化ニーズが低減され、変換自体からより強力な表現を得られることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。