Skip to main content
QUICK REVIEW

[論文レビュー] Relative Positional Encoding for Transformers with Linear Complexity

Antoine Liutkus, Ondřej Cífka|arXiv (Cornell University)|May 18, 2021
Music and Audio Processing参考文献 67被引用数 14
ひとこと要約

この論文は、学習可能なフィルタを介してランダムノイズをフィルタリングすることで、完全な注意行列の計算を避けることで線形計算量のトランスフォーマーにおける相対的位置エンコーディング(RPE)を実現する、新しい手法である確率的位置エンコーディング(SPE)を提案する。これにより、明示的な注意行列計算を伴わずにRPEに類似した誘導的バイアスを実現する。SPEは相関ガウス過程の相互共分散構造を正確に再現でき、長距離アリーナおよび音楽生成タスクにおいて正弦波PEよりも性能が向上する。

ABSTRACT

Recent advances in Transformer models allow for unprecedented sequence lengths, due to linear space and time complexity. In the meantime, relative positional encoding (RPE) was proposed as beneficial for classical Transformers and consists in exploiting lags instead of absolute positions for inference. Still, RPE is not available for the recent linear-variants of the Transformer, because it requires the explicit computation of the attention matrix, which is precisely what is avoided by such methods. In this paper, we bridge this gap and present Stochastic Positional Encoding as a way to generate PE that can be used as a replacement to the classical additive (sinusoidal) PE and provably behaves like RPE. The main theoretical contribution is to make a connection between positional encoding and cross-covariance structures of correlated Gaussian processes. We illustrate the performance of our approach on the Long-Range Arena benchmark and on music generation.

研究の動機と目的

  • 完全な注意行列の計算を回避する線形計算量のトランスフォーマー変種において、相対的位置エンコーディング(RPE)が欠落している問題に対処する。
  • RPEの知られている利点と線形注意メカニズムのスケーラビリティのギャップを埋める。
  • 明示的な注意計算を必要とせず、RPEの挙動を模倣する微分可能でパラメータ効率の良い位置エンコーディング手法を開発する。
  • 位置エンコーディングとガウス過程における相互共分散構造との間に理論的リンクを確立する。
  • SPEがRPEを一般化し、長時間系列モデリングタスクにおける性能向上を実現することを示す。

提案手法

  • 正弦波位置エンコーディングの代替として、フィルタドノイズを用いて位置に依存するクエリとキーを生成する確率的位置エンコーディング(SPE)を提案する。
  • SPEを、学習可能なフィルタを用いてホワイトノイズに適用するフィルタリングプロセスとしてモデル化し、フィルタドノイズの相互共分散が望ましいRPE構造を近似する。
  • 理論的基盤:SPEを相関ガウス過程の相互共分散に結びつけ、SPEが任意の所定の相互共分散構造を再現可能であることを示す。
  • 2つの変種を実装:正弦波SPE(SPE-S)と畳み込みSPE(SPE-C)、後者はランダムノイズを学習可能なフィルタで畳み込む。
  • 分離された注意のパラダイムに従い、SPEをクエリとキーに直接統合し、値における位置-コンテンツ相互作用を回避する。
  • バックプロパゲーションを用いてフィルタをエンドツーエンドで学習させ、全注意行列の計算を伴わず、位置に依存する注意パターンを学習可能にする。

実験結果

リサーチクエスチョン

  • RQ1完全な注意行列計算を回避する線形計算量のトランスフォーマーに、相対的位置エンコーディング(RPE)を効果的に組み込むことは可能か?
  • RQ2微分可能でパラメータ効率の良い方法で、全注意計算を必要とせずにRPEの誘導的バイアスを模倣する位置エンコーディングを生成できるか?
  • RQ3フィルタドノイズの相互共分散構造を用いて、注意メカニズムにおけるRPEの望ましい誘導的バイアスをモデル化できるか?
  • RQ4SPEは、長距離系列モデリングタスクにおけるRPEの利点を一般化するか?
  • RQ5SPEは、ドット積注意にとどまらず、特にパフォーマンスメトリクスとしての暗黙的カーネル法(例:Performer)への応用も可能か?

主な発見

  • SPEは、明示的な注意行列計算を回避することで、線形計算量のトランスフォーマーにおける相対的位置エンコーディングを成功裏に実現した。
  • SPEの畳み込みバージョン(SPE-C)は、Long-Range Arenaベンチマークで、正弦波PEおよびベースラインモデルを上回る最先端の性能を達成した。
  • 長時間系列(例:3,072トークン)を扱う音楽生成タスクにおいて、SPEは正弦波PEよりも生成品質と一貫性が向上した。
  • 理論的分析により、SPEの相互共分散構造がRPEのそれと一致させられることを示し、その設計に原理的根拠を提供した。
  • 実証的結果から、SPEはドット積注意にとどまらず、一般化可能であることが示唆され、Performerのような他の暗黙的カーネル法への応用の可能性を示した。
  • 絶対的位置エンコーディングをSPEに置き換えることで、一部の設定で性能が向上した。これは、RPEに類似した誘導的バイアスが、長距離モデリングにおいてAPEよりも効果的である可能性を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。