[論文レビュー] Your Transformer May Not be as Powerful as You Expect
この論文は、標準的な相対的位置エンコーディング(RPE)に基づくトランスフォーマーが、ソフトマックス演算子のおかげで位置情報の抽出が制限されるため、普遍的な関数近似可能でないことを明らかにした。これを克服するために、著者らは普遍的RPEに基づく(URPE)アテンションを提案し、普遍的近似の理論的条件を満たしており、パラメータ効率を伴って多様なタスクで最先端の性能を達成している。
Relative Positional Encoding (RPE), which encodes the relative distance between any pair of tokens, is one of the most successful modifications to the original Transformer. As far as we know, theoretical understanding of the RPE-based Transformers is largely unexplored. In this work, we mathematically analyze the power of RPE-based Transformers regarding whether the model is capable of approximating any continuous sequence-to-sequence functions. One may naturally assume the answer is in the affirmative -- RPE-based Transformers are universal function approximators. However, we present a negative result by showing there exist continuous sequence-to-sequence functions that RPE-based Transformers cannot approximate no matter how deep and wide the neural network is. One key reason lies in that most RPEs are placed in the softmax attention that always generates a right stochastic matrix. This restricts the network from capturing positional information in the RPEs and limits its capacity. To overcome the problem and make the model more powerful, we first present sufficient conditions for RPE-based Transformers to achieve universal function approximation. With the theoretical guidance, we develop a novel attention module, called Universal RPE-based (URPE) Attention, which satisfies the conditions. Therefore, the corresponding URPE-based Transformers become universal function approximators. Extensive experiments covering typical architectures and tasks demonstrate that our model is parameter-efficient and can achieve superior performance to strong baselines in a wide range of applications. The code will be made publicly available at https://github.com/lsj2408/URPE.
研究の動機と目的
- RPEに基づくトランスフォーマーの連続的シーケンス・ツー・シーケンス関数近似における理論的表現力の調査。
- 深さと幅があるにもかかわらず、広く使われているRPEに基づくトランスフォーマーが、特定の関数を普遍的に近似できない理由の特定。
- RPEに基づくモデルが普遍的関数近似を達成できる十分な理論的条件(アテンション条件および位置に敏感な条件)の導出。
- これらの条件を満たし、モデル容量を向上させる新しいアテンションメカニズム、URPEに基づくアテンションの設計。
- URPEに基づくトランスフォーマーの多様なアーキテクチャおよびタスクにおける優位性の実証的検証。
提案手法
- 理論的分析により、標準的なRPEアテンションにおけるソフトマックス演算子が右確率行列を生成することを特定し、これがRPEにエンコードされた位置情報の抽出能力を制限していることが判明した。
- RPEに基づくトランスフォーマーが普遍的関数近似を達成できるための2つの十分条件(アテンション条件および位置に敏感な条件)を著者らが導出した。
- 右確率行列制約を打ち破ることで、これらの条件を満たす新しいアテンションモジュール、普遍的RPEに基づく(URPE)アテンションを設計した。
- URPEアテンションは、NLPおよびグラフ学習向けの標準的なトランスフォーマー・アーキテクチャに統合され、パラメータの追加コストは最小限に抑えられた。
- 合成タスク、言語モデリング、グラフノード分類の評価が、OGB-LSCやGLUEなどの標準ベンチマークを用いて実施された。
- 公平な比較のためハイパーパrameterを調整し、複数のGPUを用いてAdam最適化法と線形学習率スケジューリングを用いてモデルを学習した。
実験結果
リサーチクエスチョン
- RQ1RPEに基づくトランスフォーマーは、任意の連続的シーケンス・ツー・シーケンス関数を普遍的に近似できるか?
- RQ2標準的なRPEに基づくトランスフォーマーは、深さと幅があるにもかかわらず、なぜ普遍的近似を達成できないのか?
- RQ3RPEに基づくトランスフォーマーが普遍的関数近似可能になるために十分な理論的条件は何か?
- RQ4これらの条件を満たす新しいアテンションメカニズムを設計できるか?
- RQ5提案されたURPEに基づくトランスフォーマーは、多様なタスクおよびアーキテクチャで一貫した性能向上を達成できるか?
主な発見
- 標準的なRPEに基づくトランスフォーマーは、ソフトマックス演算子のおかげで、RPEにエンコードされた位置情報の利用能力が制限されるため、普遍的関数近似可能でない。
- 提案されたURPEに基づくアテンションは、必要な理論的条件を満たし、RPEに基づくトランスフォーマーにおける普遍的近似を可能にした。
- MAG240Mグラフデータセットにおいて、URPEに基づくGraphormerは検証精度0.7074を達成し、元のGraphormer(0.6474)および1モデルとしての最先端性能を上回った。
- 言語事前学習では、URPEに基づくトランスフォーマーはマスクされた言語モデリング損失が1.87を記録し、RPEオンリーモデル(1.94)を上回り、APEとRPEの両方を用いたモデル(1.86)と同等の性能を発揮した。
- 合成タスク、NLP、グラフ学習の全分野において、URPEに基づくモデルは一貫した性能向上を示し、パラメータ効率と広範な適用可能性を実証した。
- 理論的分析および合成実験により、ソフトマックスに起因する右確率行列制約が、標準的なRPEに基づくアテンションにおける根本的なボトル neck であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。