Skip to main content
QUICK REVIEW

[論文レビュー] Improve Transformer Models with Better Relative Position Embeddings

Zhiheng Huang, Davis Liang|arXiv (Cornell University)|Sep 28, 2020
Topic Modeling参考文献 16被引用数 11
ひとこと要約

この論文は、自己注意機構におけるクエリ、キー、相対的位置埋め込みの間の相互作用を強化することで、Transformerにおける自己注意を向上させる一般化された相対的位置埋め込み手法を提案する。この手法は、先行する絶対位置埋め込みおよび相対位置埋め込み手法よりもSQuAD1.1の性能を向上させ、計算コストをほとんど増加させずにBERT-largeのF1スコアを93.15%から93.55%まで向上させる、ほぼ即座に置き換え可能な代替手法を実現する。

ABSTRACT

Transformer architectures rely on explicit position encodings in order to preserve a notion of word order. In this paper, we argue that existing work does not fully utilize position information. For example, the initial proposal of a sinusoid embedding is fixed and not learnable. In this paper, we first review absolute position embeddings and existing methods for relative position embeddings. We then propose new techniques that encourage increased interaction between query, key and relative position embeddings in the self-attention mechanism. Our most promising approach is a generalization of the absolute position embedding, improving results on SQuAD1.1 compared to previous position embeddings approaches. In addition, we address the inductive property of whether a position embedding can be robust enough to handle long sequences. We demonstrate empirically that our relative position embedding method is reasonably generalized and robust from the inductive perspective. Finally, we show that our proposed method can be adopted as a near drop-in replacement for improving the accuracy of large models with a small computational budget.

研究の動機と目的

  • 既存のTransformerモデルにおける相対的位置情報の未利用状態を是正すること。
  • インダクティブな視点から、より長いシーケンスに対するモデルの汎化性とロバスト性を向上させること。
  • 計算コストをほとんど増加させずに、大規模モデルの精度を向上させることを目的とした、ほぼ即座に置き換え可能な相対的位置埋め込みの開発。
  • さまざまなシーケンス長およびクリッピングしきい値の下での相対的位置埋め込みのロバスト性を実証的に検証すること。

提案手法

  • 自己注意メカニズムにおけるクエリ、キー、相対的位置埋め込みの間の相互作用を強化する一般化された相対的位置埋め込みを提案する。
  • 絶対位置埋め込みを一般化し、注意のダイナミクスを改善する学習可能な相対的位置埋め込みを導入する。
  • 相対的位置埋め込みをクエリおよびキーの計算に明示的に統合した、変更を加えた自己注意メカニズムを採用する。
  • ハイパーパramータ $k$ を用いたクリッピング機構を導入し、相対距離の範囲を制限することで、効率性と汎化性を向上させる。
  • BERT-largeにこの手法を即座に置き換える形で適用し、3エポックのみで微調整し、小さな初期学習率を用いる。
  • 注目パターンおよび埋め込み重みの可視化により、モデルの挙動を分析し、局所的注目行動を確認する。

実験結果

リサーチクエスチョン

  • RQ1クエリおよびキーとより良好に相互作用する相対的位置埋め込みを設計可能か?その結果、注目性能が向上するか?
  • RQ2提案手法の相対的位置埋め込みは、事前学習時の長さをはるかに超える長いシーケンスに対しても、堅牢に一般化可能か?
  • RQ3この手法は、計算コストをほとんど増加させずに、大規模事前学習モデルを効果的に向上させる即座に置き換え可能な代替手段として有効か?
  • RQ4クリッピングしきい値 $k$ は、さまざまなシーケンス長においてモデルの性能および汎化性にどのように影響するか?

主な発見

  • 提案手法(手法4)は、SQuAD1.1のF1スコア93.55%を達成し、ベースラインのBERT-large(93.15%)を上回る性能を示した。
  • SQuADデータ上で最大シーケンス長を増加させた微調整では、576トークンまで微調整した場合にF1スコアが最高の90.71%を記録した。
  • モデルは長時間のシーケンスに対してもロバストであり、576、640、704トークンの微調整長においても性能が安定している。
  • 可視化により、注目が顕著に局所的であることが確認され、近隣のトークンに強い注目が向けられ、遠方のトークンにはほぼゼロの注目が向かっている。これにより、小さな $k$ の使用が正当化される。
  • わずか3エポックの微調整で、パラメータ数や推論遅延の増加がほとんどない状態で、BERT-largeのF1スコアが0.4パーセンテージポイント向上した。
  • 事前学習と微調整時のシーケンス長が異なる場合でも、相対的位置埋め込みが有効であることが示され、強いインダクティブな一般化性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。