Skip to main content
QUICK REVIEW

[論文レビュー] FNet: Mixing Tokens with Fourier Transforms

James Lee-Thorp, Joshua Ainslie|arXiv (Cornell University)|May 9, 2021
Topic Modeling被引用数 14
ひとこと要約

FNetは、効率的なシーケンスモデリングのため、自己注意機構をパラメータフリーのフーリエ変換に置き換える。BERTのGLUE精度の92–97%を達成しながら、GPUでは80%速く、TPUでは70%速く学習が可能であり、長文シーケンスにおいて優れたスケーラビリティを示し、小規模モデルでも高い性能を発揮する。

ABSTRACT

We show that Transformer encoder architectures can be sped up, with limited accuracy costs, by replacing the self-attention sublayers with simple linear transformations that "mix" input tokens. These linear mixers, along with standard nonlinearities in feed-forward layers, prove competent at modeling semantic relationships in several text classification tasks. Most surprisingly, we find that replacing the self-attention sublayer in a Transformer encoder with a standard, unparameterized Fourier Transform achieves 92-97% of the accuracy of BERT counterparts on the GLUE benchmark, but trains 80% faster on GPUs and 70% faster on TPUs at standard 512 input lengths. At longer input lengths, our FNet model is significantly faster: when compared to the "efficient" Transformers on the Long Range Arena benchmark, FNet matches the accuracy of the most accurate models, while outpacing the fastest models across all sequence lengths on GPUs (and across relatively shorter lengths on TPUs). Finally, FNet has a light memory footprint and is particularly efficient at smaller model sizes; for a fixed speed and accuracy budget, small FNet models outperform Transformer counterparts.

研究の動機と目的

  • 自己注意機構をパラメータフリーの線形変換で置き換えることで、精度の大幅な損失なしにTransformerエンコーダーに適用可能かどうかを調査すること。
  • 自己注意機構の代わりに、構造的かつ効率的なトークン混合機構としてフーリエ変換の有効性を評価すること。
  • フーリエベースの混合が、特に長文シーケンスにおいて、より高速な学習と推論を実現できることを示すこと。
  • 一部の自己注意層とフーリエ混合を組み合わせたハイブリッドモデルを検討し、精度と速度のトレードオフを最適化すること。
  • 実際の長距離タスクにおいて、自己注意機構の近似手法よりも代替の混合機構が優れている可能性を立証すること。

提案手法

  • FNetは、各Transformerエンコーダーブロック内の自己注意サブレイヤーを、高速フーリエ変換(FFT)アルゴリズムを用いたパラメータフリーのフーリエ変換に置き換える。
  • フーリエ変換はシーケンス次元で作用し、周波数ドメインへの変換によって位置間のトークンを混合する。
  • 各ブロックはフーリエ混合の後に層正則化を適用し、ReLUとドロップアウトを含む標準的なフィードフォワードネットワークを実行する。
  • モデルは標準的な位置埋め込みと、分類タスク用の学習可能なプーラーヘッドを使用する。
  • ハイブリッドモデルでは、特定の位置(例:上位レイヤー)に少数の自己注意層を挿入し、残りはフーリエ混合を使用する。
  • 学習は標準的な最適化手法と学習率スケジューリングを用い、推論はGLUEおよびLong Range Arenaベンチマークで評価される。

実験結果

リサーチクエスチョン

  • RQ1パラメータフリーのフーリエ変換が、競争力のある精度を維持したまま、Transformerエンコーダー内の自己注意機構を効果的に置き換えられるか?
  • RQ2FNetの学習および推論速度は、標準的および長文シーケンスにおけるBERTおよび効率的Transformer変種と比較してどの程度か?
  • RQ3ハイブリッドFNetモデルにおいて、精度と速度のバランスを最適化するための最適な自己注意層の配置と数は何か?
  • RQ4FNetは、特に長距離タスクにおいて、さまざまな入力長にわたって性能と効率のスケーリング特性をどのように示すか?
  • RQ5自己注意機構を、FFTのような構造的線形変換に置き換えることで、パラメータ化されたまたはスパースな自己注意近似手法よりも利点が得られるか?

主な発見

  • FNetは、512の入力長において、BERT-BaseおよびBERT-LargeのGLUEベンチマークでそれぞれ92–97%の精度を達成し、GPUでは80%速く、TPUでは70%速く学習が可能である。
  • Long Range Arenaベンチマークでは、FNetは最も正確な効率的Transformerと同等の精度を示し、GPU上ではすべてのシーケンス長でそれらを上回る速度性能を発揮する。
  • 長文シーケンスでは、FNetはGPU上ですべての評価対象の効率的Transformerモデルよりも速く、TPU上では短いシーケンスにおいても最も高速なモデルを上回る。
  • 上位に2つの自己注意層を配置したハイブリッドFNetモデルは、BERTの精度の97–99%を達成しながらも、40–70%速く学習が可能である。
  • FNetはより小さなメモリフットプリントを有し、特に小規模モデルにおいて、固定された速度と精度の予算下で標準Transformerモデルを上回る性能を示す。
  • フーリエ変換のO(N log N)の複雑度は、O(N²)の自己注意機構ですら近似された場合でも、実用的なスケーラビリティにおいて優れた性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。