[論文レビュー] A Length-Extrapolatable Transformer
本稿では、相対的位置埋め込み(xPos)とブロックワイドな因果注意を用いて、長文脈モデリングを強化する長さ拡張可能な注目メカニズム「LeX Transformer」を提案する。注目解像度を最大化し、学習時に見られなかった長さのシーケンスにおいても安定した性能を発揮することで、内挿と外挿の両方において優れた結果を達成し、従来の手法を上回る性能を示した。
Position modeling plays a critical role in Transformers. In this paper, we focus on length extrapolation, i.e., training on short texts while evaluating longer sequences. We define attention resolution as an indicator of extrapolation. Then we propose two designs to improve the above metric of Transformers. Specifically, we introduce a relative position embedding to explicitly maximize attention resolution. Moreover, we use blockwise causal attention during inference for better resolution. We evaluate different Transformer variants with language modeling. Experimental results show that our model achieves strong performance in both interpolation and extrapolation settings. The code will be available at https://aka.ms/LeX-Transformer.
研究の動機と目的
- 訓練時に見られた長さよりも長いシーケンス長に一般化できないTransformerの顕著な制限を解消すること。
- モデルがより長いシーケンスに外挿できる能力を定量化する指標「注目解像度」を定義・最適化すること。
- RoPE や Alibi を改善する高解像度かつ安定性を保つ相対的位置埋め込み(xPos)を設計すること。
- 再トレーニングを必要とせず、短文脈性能を損なわずに長文脈でも優れた性能を発揮できるようにすること。
- ブロックワイドな因果注意が自己回帰的言語モデリングにおける解像度向上と外挿性能の向上に寄与することを示すこと。
提案手法
- RoPEに基づくが、回転行列に指数関数的減衰を導入することで一般化された相対的位置埋め込みであるxPosを提案し、注目解像度を向上させる。
- 注目解像度を定義し、長文脈における位置の区別がどの程度保持されるかを定量化する指標として用いる。
- 推論時にブロックワイドな因果注意(BCA)を導入することで、局所的ブロックに注目を制限しつつも長距離依存関係を維持し、解像度を向上させる。
- クエリとキーの相互作用をxPos埋め込みで調整することで、相対的位置を高精度に符号化する修正された自己注意メカニズムを採用する。
- 順序不変性と平行移動不変性を満たす普遍的な設計原理を採用し、入力長の変動に対しても堅牢性を確保する。
- 標準的な密な注意を用いて事前学習からモデルを訓練し、標準長の入力でも効率的かつ高性能を維持する。
実験結果
リサーチクエスチョン
- RQ1極めて長いシーケンスにおいても高解像度を維持できる相対的位置埋め込みを設計できるか。これにより、学習長より長い長さへの外挿が可能になるか。
- RQ2ブロックワイドな因果注意は、長文脈言語モデリングにおける注目解像度と性能にどのように影響するか。
- RQ3提案されたxPos埋め込みは、短文脈および長文脈の両設定でRoPE や Alibi を上回る性能を示すか。
- RQ4短いシーケンスで学習したモデルが、再トレーニングやアーキテクチャの変更なしに、非常に長いシーケンスにうまく一般化できるか。
- RQ5提案手法における外挿性能の向上と推論コストのトレードオフは何か。
主な発見
- LeX Transformerは事前学習中の検証セットで最小のパープレキシティを達成しており、分布内性能が優れていることを示している。
- 平均長が6,000以上のarXivデータセットでは、他のモデルがパーセプトリーが頭打ちまたは上昇する中、LeX Transformerはシーケンス長が延びるにつれてパープレキシティを継続的に低下させている。
- ブロックワイドな因果注意を用いない同じモデルと比較して、2048トークンでは約1、4096トークンでは約8のパープレキシティ低減が達成された。
- ブロックワイドな因果注意は、RoPEベースのモデルが長距離でパープレキシティの爆発を回避するために不可欠であるが、Alibi は元々ソフトな注目窓を持つため、それほど重要ではない。
- 標準長のシーケンスでも優れた性能を維持しており、短文脈と長文脈の能力の間でトレードオフがないことが示された。
- xPosは絶対位置埋め込みと比較して推論コストが約6%増加するのみで、トレーニング収束が速い。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。