[論文レビュー] Pay Attention when Required
この論文では、WikiText-103 で最先端のパープレキシティを維持しながら、自己注意機構のブロックを 63% 減少させるより効率的な Transformer アーキテクチャ、PAR Transformer を提案する。微分可能ニューラルアーキテクチャ探索(NAS)を用いて、自己注意機構は層の最初の三分の二でのみ必要であることが同定された。これにより、複数のデータセットおよびモデル(BERT を含む)で精度に損なわれることなく 35% の低い推論遅延を達成した。
Transformer-based models consist of interleaved feed-forward blocks - that capture content meaning, and relatively more expensive self-attention blocks - that capture context meaning. In this paper, we explored trade-offs and ordering of the blocks to improve upon the current Transformer architecture and proposed PAR Transformer. It needs 35% lower compute time than Transformer-XL achieved by replacing ~63% of the self-attention blocks with feed-forward blocks, and retains the perplexity on WikiText-103 language modelling benchmark. We further validated our results on text8 and enwiki8 datasets, as well as on the BERT model.
研究の動機と目的
- 自己注意機構とフィードフォワードブロックの配置と比率を再考することで、Transformerアーキテクチャを最適化すること。
- 大規模言語モデルにおける計算コストと推論遅延を、パフォーマンスを損なわず低減すること。
- ブロックの順序と構成に焦点を当て、自動探索を通じて最適なアーキテクチャパターンを同定すること。
- 複数のデータセット(WikiText-103、enwiki8、text8)およびモデルタイプ(BERT、Transformer-XL)にわたる一般化の妥当性を検証すること。
- 微分可能ニューラルアーキテクチャ探索を用いて、説明可能で効率的なTransformerファミリーの設計手法を提供すること。
提案手法
- 自己注意、フィードフォワード、アイデンティティの3種類のブロックタイプを含む探索空間を用いた微分可能ニューラルアーキテクチャ探索(NAS)を採用した。
- 各層を3種類のブロックタイプの微分可能重み付き組み合わせとして構築し、トレーニング中にGumbel-Softmaxを用いてサンプリングした。
- 1つのスーパーネットを訓練し、精度と効率を同時に最適化することで、3^32通りの可能なアーキテクチャに対して線形時間の複雑さを持つ探索を可能にした。
- 学習された注目確率をもとに設計ルールを導出:自己注意機構は層の最初の三分の二でのみ必要であり、自己注意ブロックとフィードフォワードブロックの比がp:1(p=5)が最適である。
- 導出されたルールを応用して、注目ブロックを削減したが性能を維持するPAR TransformerおよびPAR BERTモデルを構築した。
- 標準的なハイパーパrameterおよび推論設定を用い、複数のベンチマーク(WikiText-103、enwiki8、text8)およびタスク(言語モデリング、QA、センチメント分析)で結果を検証した。
実験結果
リサーチクエスチョン
- RQ1Transformerエンコーダーにおける自己注意とフィードフォワードブロックの最適な順序と比率は何か?
- RQ2追加の自己注意ブロックがパフォーマンス向上に与える寄与度が、どこで飽和するか?
- RQ3自己注意ブロックの数を減らしても、モデルの精度を維持しながら推論コストを著しく低減できるか?
- RQ4最適なアーキテクチャパターンは、異なるデータセットやモデルアーキテクチャ(例:BERT、Transformer-XL)に一般化可能か?
- RQ5微分可能NASを用いて、説明可能で効率的なTransformerアーキテクチャ設計ルールを導出できるか?
主な発見
- PAR Transformer は、Transformer-XL と比較して自己注意ブロックを 63% 減少させ、WikiText-103 で同じパープレキシティを達成しながら推論遅延を 35% 低減した。
- 最適なアーキテクチャでは、自己注意機構は層の最初の三分の二でのみ使用され、フィードフォワードブロックと自己注意ブロックの比が 5:1 が最適である。
- WikiText-103 データセットにおいて、PAR Transformer Base は Transformer-XL Base と同等のテストパープレキシティを維持しながら、遅延を 0.65 倍にまで低減した。
- PAR の設計ルールは他のデータセットにも一般化可能である:enwiki8 および text8 においても、計算量を削減した上で同等のパフォーマンスを達成した。
- PAR BERT Base は、自己注意ブロックを半分に減らしても、事前学習損失および MRPC/SST-2 ファインチューニングで BERT Base と同等のパフォーマンスを示した。SQuAD v1.1 では1%の精度低下を示したが、これは顕著な性能低下とは言えない。
- PAR BERT は、DistilBERT と同等の遅延を達成しながら、2倍の層数を有し、より単純なトレーニングパラダイムを採用していた。これは、蒸留技術を用いずに、アーキテクチャの効率化が可能であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。