Skip to main content
QUICK REVIEW

[論文レビュー] LazyFormer: Self Attention with Lazy Update

Chengxuan Ying, Guolin Ke|arXiv (Cornell University)|Feb 25, 2021
Topic Modeling参考文献 24被引用数 9
ひとこと要約

LazyFormerは、複数層のブロックごとに自己注意計算を1回だけ実行し、その後の層で再利用することで、自己注意計算を軽量化する軽量なTransformerアーキテクチャを提案する。標準BERTと同等の性能を維持しながら推論速度を1.3倍に向上させ、同じ計算リソース予算内でより大きなモデルや長文系列処理の効率性を実現する。

ABSTRACT

Improving the efficiency of Transformer-based language pre-training is an important task in NLP, especially for the self-attention module, which is computationally expensive. In this paper, we propose a simple but effective solution, called \emph{LazyFormer}, which computes the self-attention distribution infrequently. LazyFormer composes of multiple lazy blocks, each of which contains multiple Transformer layers. In each lazy block, the self-attention distribution is only computed once in the first layer and then is reused in all upper layers. In this way, the cost of computation could be largely saved. We also provide several training tricks for LazyFormer. Extensive experiments demonstrate the effectiveness of the proposed method.

研究の動機と目的

  • 自己注意の計算量が二次関数的になる問題、特に長文系列における課題を軽減すること。
  • 自己注意分布が連続する隣接層間で安定しており、再利用可能かどうかを調査すること。
  • 性能を維持しつつFLOPsを著しく削減できる効率的なTransformerの変種を設計すること。
  • 同じ事前学習リソース予算内で、より大きなモデルや長文系列の処理を可能にすること。

提案手法

  • LazyFormerはTransformer層を'm個の層'を含む'ラージブロック'にグループ化する。
  • 各ラージブロック内で、自己注意は最初の層でのみ計算され、以降の上位層で再利用される。
  • この方法により、合計の自己注意FLOPsはO(kn²)からO(kn²/m)に削減される。ここでmは1ブロックあたりの層数である。
  • 共有された自己注意計算によるパラメータ数の削減を補うために、層の幅(隠れ層・全結合層の次元)を拡大する。
  • 性能に悪影響を与えないように、自己注意モジュールからドロップアウトを削除することで、さらに効率性を向上させる。
  • 標準的な事前学習目的関数を用い、幅と深さを調整したBERTベースの設定でモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1自己注意分布を複数のTransformer層にわたって再利用しても、顕著な性能低下が生じないか?
  • RQ2自己注意の計算頻度を低くすることで、事前学習および推論における明確な効率性向上が得られるか?
  • RQ3LazyFormerは、同じ計算リソース予算内でより大きなモデルや長文系列を学習可能か?
  • RQ4自己注意からドロップアウトを削除することは、ラージ注意の文脈で効率性と性能にどのような影響を与えるか?

主な発見

  • LazyFormerは、標準BERTと同等のモデル容量を維持しながら、性能に低下を来さずに推論速度を1.3倍に向上させる。
  • 同じ事前学習コストを用いた場合、より大きなLazyFormerモデル(M2x6)はGLUE平均スコアでBERTを1.0ポイント上回る。
  • 事前学習コストの50%のみで、LazyFormerはBERTを上回るGLUEスコアを達成し、顕著な効率性の向上を示す。
  • 事前学習段階で収束が早く、M2x6-SはBERTの半分の学習ステップで競争力のある性能に到達する。
  • シーケンス長が長いほどスピードアップが顕著になり、計算量のO(n²)の支配的要因により、長文処理ではほぼ2倍のスピードアップが達成される。
  • 自己注意からドロップアウトを削除することで、約10%の効率性向上が得られ、わずかな性能向上も確認され、この文脈ではドロップアウトが必須でないことが裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。