Skip to main content
QUICK REVIEW

[論文レビュー] Repulsive Attention: Rethinking Multi-head Attention as Bayesian Inference

Bang An, Jie Lyu|arXiv (Cornell University)|Sep 20, 2020
Topic Modeling参考文献 38被引用数 7
ひとこと要約

本稿では、注意頭同士の多様性を保つために粒子最適化サンプリングを用いるベイジアン解釈に基づく「反発的アテンション」を提案する。各注意頭を事後分布を近似する粒子としてモデル化することで、追加パラメータを導入せずに特徴の多様性とモデルの表現力が向上し、NLPタスク全体で一貫した性能向上が達成される。

ABSTRACT

The neural attention mechanism plays an important role in many natural language processing applications. In particular, the use of multi-head attention extends single-head attention by allowing a model to jointly attend information from different perspectives. Without explicit constraining, however, multi-head attention may suffer from attention collapse, an issue that makes different heads extract similar attentive features, thus limiting the model's representation power. In this paper, for the first time, we provide a novel understanding of multi-head attention from a Bayesian perspective. Based on the recently developed particle-optimization sampling techniques, we propose a non-parametric approach that explicitly improves the repulsiveness in multi-head attention and consequently strengthens model's expressiveness. Remarkably, our Bayesian interpretation provides theoretical inspirations on the not-well-understood questions: why and how one uses multi-head attention. Extensive experiments on various attention models and applications demonstrate that the proposed repulsive attention can improve the learned feature diversity, leading to more informative representations with consistent performance improvement on various tasks.

研究の動機と目的

  • マルチヘッドアテンションにおける注意の崩壊問題に対処すること。すなわち、ヘッドが重複した特徴を学習し、モデルの表現力が制限されることを防ぐ。
  • マルチヘッドアテンションがシングルヘッドアテンションよりも優れる理由を、原理的かつ理論的根拠をもって説明すること。
  • 追加のトレーナブルパラメータや明示的正則化を導入せずに、注意ヘッドの多様性を向上させる手法を開発すること。
  • ベイジアン解釈が多様なアテンションベースのモデルやNLPタスクにわたって有効であることを実証すること。

提案手法

  • 本稿では、マルチヘッドアテンションをベイジアン推論問題として定式化し、各注意ヘッドを注意パラメータの事後分布からのサンプリング粒子として扱う。
  • 粒子最適化サンプリング技術(Liu & Wang, 2016)を用いて、パラメータ空間におけるヘッド同士の近接度を最小化することで、ヘッド間の反発性を強制する。
  • 明示的正則化を避けるために、最適化過程における粒子同士の固有の相違性に依存し、パラメータ空間内の異なるモードへの探索を促進する。
  • エンドツーエンドの学習スキームを用いて、粒子最適化を標準的なアテンションモジュールに統合するフレームワークを実装する。
  • 本手法は、Transformer、BERT、およびシーケンス・トゥ・シーケンスアーキテクチャを含む、さまざまなアテンションモデルに一般化可能である。

実験結果

リサーチクエスチョン

  • RQ1なぜマルチヘッドアテンションはシングルヘッドアテンションよりもモデル性能を向上させるのか?
  • RQ2追加のトレーナブルパラメータを導入せずに、どのように注意ヘッドの多様性を明示的に促進できるか?
  • RQ3マルチヘッドアテンションが多様な表現を捉えるのに有効である理論的根拠は何か?
  • RQ4注意ヘッド同士に反発性を強制することで、さまざまなNLPタスクで一貫した性能向上が得られるか?

主な発見

  • 反発的アテンションは、マルチヘッドアテンションにおける特徴の多様性を顕著に向上させ、ヘッド間の冗長性を低減した。
  • 本手法は、テキスト分類、機械翻訳、要約生成といった複数のNLPタスクで一貫した性能向上を達成した。
  • IWSLT14 De-En翻訳タスクにおいて、反発的アテンションを適用したTransformer-smallモデルは、標準的なマルチヘッドアテンションよりも低い負の対数尤度損失を達成した。
  • 要約生成タスクでは、反発的アテンションを搭載したGraphWriterモデルが、知識グラフカバレッジで10%の向上を示し、繰り返しの多い節を減少させた。
  • 人間による評価では、反発的アテンションを用いた生成テキストが、ベースラインモデルに比べて構造的により整合性があり、情報量が多いと確認された。
  • 実験から、最適な注意ヘッド数(Yelp感情分析では約20、Transformer-smallでは4)が存在することが判明し、多様性と過学習のトレードオフに関する理論的分析を裏付ける結果となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。