Skip to main content
QUICK REVIEW

[論文レビュー] RealFormer: Transformer Likes Residual Attention

Ruining He, Anirudh Ravula|arXiv (Cornell University)|Dec 21, 2020
Topic Modeling参考文献 38被引用数 20
ひとこと要約

RealFormerは、注意スコアに残差接続を追加することで、パラメータフリーの単純な手法を導入し、GLUE、SQuAD、機械翻訳を含む多様なNLPタスクにおいて顕著な性能向上を達成する。高速な収束性とよりスパースで安定した注意パターンを実現し、最先端の結果を達成する。

ABSTRACT

Transformer is the backbone of modern NLP models. In this paper, we propose RealFormer, a simple and generic technique to create Residual Attention Layer Transformer networks that significantly outperform the canonical Transformer and its variants (BERT, ETC, etc.) on a wide spectrum of tasks including Masked Language Modeling, GLUE, SQuAD, Neural Machine Translation, WikiHop, HotpotQA, Natural Questions, and OpenKP. We also observe empirically that RealFormer stabilizes training and leads to models with sparser attention. Source code and pre-trained checkpoints for RealFormer can be found at https://github.com/google-research/google-research/tree/master/realformer.

研究の動機と目的

  • パラメータやハイパーパrameterを追加せずに、多様なNLPタスクにおけるTransformerベースのモデルの性能を向上させること。
  • ResNetにおける残差接続と同様に、注意スコアに直接パスを設けることで、訓練の安定性と一般化性能の向上が可能かどうかを調査すること。
  • BERT、ADMIN、ETCのような既存モデルに、残差注意をそのまま差し込むことで、その有効性を評価すること。
  • 特に、スパarsityと層間相関の観点から、RealFormerにおける注意メカニズムの定性的な挙動を分析すること。

提案手法

  • 前の層から得た元の注意スコアを直接現在の層に伝達するスキップ接続を追加することで、残差注意メカニズムを導入する。
  • 標準的なTransformerエンコーダーブロックを変更し、元の多頭注意スコアと、前の層からの注意スコアの残差ストリームを組み合わせ、その後でソフトマックスを適用する。
  • 累積和を残差成分として使用し、元の注意計算を保存しつつ、残差パスを通じた勾配の流れを可能にする。
  • エンコーダー、デコーダー、およびETCのようなスパース注意機構を含む、さまざまなTransformerバリアントに普遍的に適用する。
  • ベースラインモデルと同一の事前学習および微調整のレシピを用い、公平な比較を実現する。最小限のコード変更で実装可能である。
  • 推論時にチェックポイント平均化を適用し、特に大規模モデルの堅牢性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1標準的および最先端のTransformerモデルに、注意スコアに残差接続を追加することで、多様なNLPタスクにおける性能向上が達成できるか?
  • RQ2残差注意は、Post-LNおよびPre-LN Transformerと比較して、より安定した訓練ダイナミクスと高速な収束を実現するか?
  • RQ3残差注意は、学習済みモデルにおける注意のスパarsityと層間相関にどのように影響を与えるか?
  • RQ4RealFormerは、アーキテクチャやハイパーパrameterの変更なしに、既存のTransformerアーキテクチャに対して汎用的かつ即座に適用可能な改善手法として機能するか?
  • RQ5残差注意により、標準ベースラインと比較して、少ない事前学習エポック数で優れた性能が得られるか?

主な発見

  • マスク言語モデルと下流のGLUEタスクにおいて、RealFormerはすべてのモデルサイズでPost-LNおよびPre-LN Transformerを上回り、平均して最大2.5ポイントの向上を達成する。
  • WMT’14 En-Fr翻訳ベンチマークでは、50エポックの事前学習でのみ、43.97の新しいSOTA BLEUスコアを達成し、ベースラインのADMINモデルを0.25 BLEUポイント上回る。
  • WikiHopベンチマークでは、84.4%の精度に向上し、前回SOTAから2.1%の絶対的向上を達成し、公式リーダーボードで1位を獲得した。
  • RealFormerは、ETC-Largeが4つの長文脈ベンチマークすべてで向上を示した:HotpotQA(共同F1: 73.57 vs. 73.12)、Natural Questions(平均F1: 68.51 vs. 68.07)、OpenKP(F1@3: 44.27 vs. 44.06)。
  • 定性的な分析から、RealFormerはヘッド内および隣接層間でよりスパースな注意パターンを生成することが示され、訓練の安定化に寄与する正則化効果があると考えられる。
  • ベースラインモデルの半分の事前学習エポック数でさえも、競争力ある微調整結果を達成しており、収束が速く、より高いデータ効率であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。