Skip to main content
QUICK REVIEW

[論文レビュー] Tensorized Self-Attention: Efficiently Modeling Pairwise and Global Dependencies Together

Tao Shen, Tianyi Zhou|arXiv (Cornell University)|May 2, 2018
Topic Modeling参考文献 54被引用数 5
ひとこと要約

本稿では、ドット積と加法的アテンションをテンソル化されたマルチヘッドフレームワーク内で統合することにより、ペairワイズ(トークン対トークン)およびグローバル(ソース対トークン)依存関係を効率的にモデル化する、新しいアテンションメカニズムであるマルチマスクテンソル化自己アテンション(MTSA)を提案する。MTSAは、モデルサイズに変化がないまま、標準的な自己アテンションやマルチヘッドアテンションを上回る精度を達成しながら、CNNと同等のメモリおよび計算効率を維持し、9つのNLPベンチマークで最先端または競争力のある性能を達成した。

ABSTRACT

Neural networks equipped with self-attention have parallelizable computation, light-weight structure, and the ability to capture both long-range and local dependencies. Further, their expressive power and performance can be boosted by using a vector to measure pairwise dependency, but this requires to expand the alignment matrix to a tensor, which results in memory and computation bottlenecks. In this paper, we propose a novel attention mechanism called "Multi-mask Tensorized Self-Attention" (MTSA), which is as fast and as memory-efficient as a CNN, but significantly outperforms previous CNN-/RNN-/attention-based models. MTSA 1) captures both pairwise (token2token) and global (source2token) dependencies by a novel compatibility function composed of dot-product and additive attentions, 2) uses a tensor to represent the feature-wise alignment scores for better expressive power but only requires parallelizable matrix multiplications, and 3) combines multi-head with multi-dimensional attentions, and applies a distinct positional mask to each head (subspace), so the memory and computation can be distributed to multiple heads, each with sequential information encoded independently. The experiments show that a CNN/RNN-free model based on MTSA achieves state-of-the-art or competitive performance on nine NLP benchmarks with compelling memory- and time-efficiency.

研究の動機と目的

  • グローバル依存関係をモデル化するための多次元自己アテンションメカニズムの非効率さと高いメモリコストを解消すること。
  • トークン対トークンおよびソース対トークンアテンションの長所を統合し、計算効率を損なわずにより豊かな文脈的モデリングを実現すること。
  • 異なる位置マスクを有する複数のヘッドにテンソル化アテンションを分散させることで、長大なシーケンスに対するスケーラブルで並列化可能な計算を可能にすること。
  • モデルサイズの増加なしに、CNNと同等の低メモリおよび時間計算量を維持しながら、NLPタスクで最先端の性能を達成すること。

提案手法

  • MTSAは、ペアワイズトークン依存関係にドット積アテンションを、グローバルな特徴ワイズ依存関係に加法的アテンションを組み合わせたハイブリッド適合関数を用いる。
  • 表現力の向上を図るため、アライメントスコアを3次元テンソルとして表現するが、高価なテンソル演算ではなく、効率的な行列乗算によって計算する。
  • 各ヘッドに独立した位置マスクを備えたマルチヘッドアテンションを採用し、並列計算を可能にするとともに、順序構造のより良いモデリングを実現する。
  • 各アテンションヘッドは特徴空間の別々の部分空間を処理し、ヘッド間でメモリおよび計算負荷を分散する。
  • 特徴レベルでの多次元アテンション統合により、各特徴が独自のグローバル重要度スコアを持つことができ、表現力の向上が図られる。
  • フレームワークはプラグアンドプレイ設計であり、Transformerなどのモデルに標準的なマルチヘッド自己アテンションを置き換えるだけで実装可能である。

実験結果

リサーチクエスチョン

  • RQ12次関数的なメモリおよび計算コストを伴わず、ペアワイズおよびグローバル依存関係を効率的にモデル化できる自己アテンションメカニズムは存在するか?
  • RQ2テンソル化された多次元アテンションとマルチヘッド、位置マスクの組み合わせが、モデルの性能および効率に与える影響は何か?
  • RQ3MTSAに基づくCNN/RNNフリーのモデルは、多様なNLPタスクで最先端の結果を達成できるか? また、低メモリおよび時間計算量を維持できるか?
  • RQ4各ヘッドに異なる位置マスクを用いることで、順序的および相対的位置情報のモデリングが向上するか?

主な発見

  • SNLI自然言語推論ベンチマークでは、MTSAが95.3%のテスト精度を達成し、マルチヘッドアテンションやCNNを含むすべてのベースラインを上回った。
  • 5つの文類似分類タスクでは、CR、MPQA、TREC、SST-5で最高の精度を記録し、次に良いモデルよりも最大0.5%の向上を達成した。
  • WMT 2014 英語=ドイツ語機械翻訳タスクでは、2つの学習設定すべてにおいてマルチヘッド自己アテンションを顕著に上回り、p値はそれぞれ0.001および0.080であった。
  • MTSAは、CNNと同等のメモリおよび計算コストを維持しており、モデルサイズの顕著な増加はなく(61.58Mパラメータ対61.38Mパラメータ)、Transformerと同等であった。
  • 感情分析、意味的役割ラベリング、質問タイプ分類を含む多様なNLPタスクにおいて、一貫した性能向上を示し、競争力のある推論速度と低メモリ負荷を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。