Skip to main content
QUICK REVIEW

[論文レビュー] Mask Attention Networks: Rethinking and Strengthen Transformer

Zhihao Fan, Yeyun Gong|arXiv (Cornell University)|Mar 25, 2021
Topic Modeling参考文献 25被引用数 7
ひとこと要約

本稿では、局所構造モデリングを向上させるために、文脈に応じた可変マスクを学習する、トランスフォーマーの性能を向上させる新しいアテンション機構であるダイナミックマスクアテンションネットワーク(DMAN)を提案する。自己アテンションネットワーク(SAN)とフィードフォワードネットワーク(FFN)を、静的マスクを持つマスクアテンションネットワーク(MAN)の特殊ケースとして統一することで、文脈および距離に依存する学習可能なマスクを持つDMANを導入し、隣接トークンへの注目を強化した。順序的なDMAN → SAN → FFNアーキテクチャにより、ニューラル機械翻訳およびテキスト要約で最先端の性能を達成した。

ABSTRACT

Transformer is an attention-based neural network, which consists of two sublayers, namely, Self-Attention Network (SAN) and Feed-Forward Network (FFN). Existing research explores to enhance the two sublayers separately to improve the capability of Transformer for text representation. In this paper, we present a novel understanding of SAN and FFN as Mask Attention Networks (MANs) and show that they are two special cases of MANs with static mask matrices. However, their static mask matrices limit the capability for localness modeling in text representation learning. We therefore introduce a new layer named dynamic mask attention network (DMAN) with a learnable mask matrix which is able to model localness adaptively. To incorporate advantages of DMAN, SAN, and FFN, we propose a sequential layered structure to combine the three types of layers. Extensive experiments on various tasks, including neural machine translation and text summarization demonstrate that our model outperforms the original Transformer.

研究の動機と目的

  • 自己アテンションネットワーク(SAN)とフィードフォワードネットワーク(FFN)を、静的マスクを持つ統一されたマスクアテンションネットワーク(MAN)フレームワークの特殊ケースとして再定式化すること。
  • テキスト表現における局所的依存関係をモデリングする上で、SANとFFNにおける静的マスクの限界を特定すること。
  • 文脈および相対的なトークン距離に依存する学習可能なマスクを持つダイナミックマスクアテンションネットワーク(DMAN)を提案し、局所構造をよりよく捉えること。
  • DMAN、SAN、FFNの長所を効果的に組み合わせる新しい順序的アーキテクチャ(DMAN → SAN → FFN)を設計すること。
  • 提案モデルをニューラル機械翻訳および要約抽出的テキスト要約タスクにおいて実証的に検証すること。

提案手法

  • アテンションをキーベースのアテンション行列とマスク行列の要素ごとの積として計算するマスクアテンションネットワーク(MAN)として、SANとFFNを再定式化する。
  • SANのマスク行列をすべて1の行列、FFNのマスク行列を単位行列として定義し、これらをMANの特殊ケースとして確立する。
  • クエリの文脈と相対的なトークン距離に基づいて動的に適応する学習可能なマスク行列を持つDMANを提案する。
  • DMAN → SAN → FFNという順序的アーキテクチャを設計し、DMANが局所的文脈モデリングを強化した後、SANが長距離依存関係を捉え、FFNが非線形変換を実行する。
  • 標準的なトランスフォーマーの目的関数に従い、エンド・トゥ・エンドでモデルを学習し、動的マスクを用いて局所的なウィンドウ内にあるトークンに強く注目する。
  • ウィンドウサイズ $w$ の範囲内でアテンションスコアの寄与度を計算し、$attn\_s_{w,l,*}$ を用いて局所的アテンション効果を定量化する。

実験結果

リサーチクエスチョン

  • RQ1自己アテンションネットワーク(SAN)とフィードフォワードネットワーク(FFN)を、共通のフレームワークに体系的に統一することは可能か?
  • RQ2SANとFFNにおける静的マスク行列が、テキスト表現における局所的依存関係のモデリングを制限する理由は何か?
  • RQ3学習可能な動的マスク機構は、グローバルモデリング能力を損なわせることなく、トランスフォーマーにおける局所構造モデリングを向上させられるか?
  • RQ4DMAN、SAN、FFNを最適に組み合わせるアーキテクチャ的構成は何か?
  • RQ5提案されたDMAN機構は、標準的な自己アテンションと比較して、隣接トークンへの注目をどの程度強化するか?

主な発見

  • IWSLT14 De-Enテストセットのレイヤー1において、ウィンドウサイズ2のDMANは、SANに比べて隣接トークンへのアテンションスコア寄与度が50%高い。一部のケースでは最大5倍の差を示した。
  • ウィンドウサイズ4では、DMANはレイヤー1で95.09%のアテンションスコア寄与度を達成したのに対し、SANは30.38%にとどまり、局所的アテンションモデリングの優位性が明確に示された。
  • 提案されたDMAN → SAN → FFNアーキテクチャは、ニューラル機械翻訳および要約抽出的テキスト要約タスクの両方で、元のトランスフォーマーを上回った。
  • DMANの動的マスクは、非隣接で間接的に関連するトークンからのノイズを効果的に低減し、それらのアテンションスコアを抑制した。
  • アテンションスコア分析の結果、DMANは特に局所パターンが重要な初期レイヤーにおいて、SANよりも顕著に局所ウィンドウ内のトークンに高い注目を割り当てることが確認された。
  • モデルの性能向上は、DMANが局所的文脈を適応的に強調しつつも、SANのグローバルモデリング能力とFFNの非線形変換能力を維持できる点に起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。