Skip to main content
QUICK REVIEW

[論文レビュー] Evolving Attention with Residual Convolutions

Yujing Wang, Yaming Yang|arXiv (Cornell University)|Feb 20, 2021
Topic Modeling参考文献 29被引用数 10
ひとこと要約

本論文は、残差接続と2次元畝込みモジュールを用いて層間で注目マップを進化させる新しいメカニズムであるEvolving Attention (EA-Transformer)を提案する。注目マップをマルチチャネル特徴マップとして扱い、畝込みによる進化で精錬することで、画像認識および自然言語処理のタスクにおいて一貫した精度向上を達成し、ImageNet、GLUE、IWSLTベンチマークで最先端の性能を示す。

ABSTRACT

Transformer is a ubiquitous model for natural language processing and has attracted wide attentions in computer vision. The attention maps are indispensable for a transformer model to encode the dependencies among input tokens. However, they are learned independently in each layer and sometimes fail to capture precise patterns. In this paper, we propose a novel and generic mechanism based on evolving attention to improve the performance of transformers. On one hand, the attention maps in different layers share common knowledge, thus the ones in preceding layers can instruct the attention in succeeding layers through residual connections. On the other hand, low-level and high-level attentions vary in the level of abstraction, so we adopt convolutional layers to model the evolutionary process of attention maps. The proposed evolving attention mechanism achieves significant performance improvement over various state-of-the-art models for multiple tasks, including image classification, natural language understanding and machine translation.

研究の動機と目的

  • 各層で独立に学習される注目マップの限界に対処する。特に、正確で変化する依存関係を捉えることができない点を改善する。
  • 層間での注目パターンの進化をモデル化するインダクティブバイアスを導入することで、注目マップの品質を向上させる。
  • 残差接続と畝込み特徴の進化を通じて、層間での知識共有を促進し、モデルの解釈可能性と性能を向上させる。
  • ビジョン・トランスフォーマーやBERT、アテンション付きResNetなど、さまざまなアテンションベースのアーキテクチャに適用可能な汎用的でプラグイン可能なメカニズムを開発する。
  • 注目マップの進化が、入力データの構造的・意味的依存関係をより正確に反映するシャープで信頼性の高い注目パターンを生成することを示す。

提案手法

  • 各トランスフォーマーブロックからのマルチヘッドアテンションマップを、Cがアテンションヘッド数であるH × W × Cのマルチチャネル特徴マップとして扱う。
  • これらの注目マップを2次元畝込みモジュールに供給し、次のブロック用に精錬された注目マップに進化させる。
  • 元の注目マップと進化後のマップの間に残差接続を設け、トランスフォーマー内のトークン間依存関係の知識を保持・伝達する。
  • 複数の畝込みモジュールをブロック間でチェーンすることで、階層的抽象化を模倣する段階的進化プロセスを形成する。
  • ビジョン・トランスフォーマー、BERT、AA-ResNetなど、既存のトランスフォーマーおよび自己アテンションアーキテクチャに、進化アテンションモジュールをプラグインとして統合する。
  • 畝込みヘッドが局所的文脈とグローバル構造的事前知識に基づいて注目パターンを精錬するように、モデル全体をエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1注目マップを個別に学習する代わりに、その進化をモデル化することで、トランスフォーマーの各層で体系的に改善可能か?
  • RQ2注目マップに畝込みインダクティブバイアスを導入することで、その精度と構造的忠実性が向上するか?
  • RQ3注目マップ間の残差接続が、層間での知識伝達と性能向上にどの程度寄与するか?
  • RQ4進化アテンションメカニズムは、コンピュータビジョンおよび自然言語処理の異なるアーキテクチャやタスクに一般化可能か?
  • RQ5向上した注目マップの品質が、予測根拠の解釈可能性と信頼性の向上に寄与するか?

主な発見

  • ImageNet分類タスクにおいて、EA-AA-ResNet-34は31.93%のトップ1精度を達成し、AA-ResNet-34よりも0.5%の向上を示した。
  • GLUEベンチマークでは、EA-BERTがBERT-Baseの性能を2.4ポイント、RoBERTa-Largeを0.8ポイント、T5-Baseを1.1ポイント向上させた。
  • ERASER解釈可能性ベンチマークでは、vanilla BERTに比べてEA-BERTはより包括的(↑0.013)かつ過剰でない(↓0.01)根拠を生成し、信頼性の向上を示した。
  • ImageNetにおける注目マップ分類精度は、EA-AA-ResNet-34で顕著に向上し、16番目、17番目、18番目の層のマップがAA-ResNet-34のそれよりも高い精度を示しており、構造的忠実性の向上を裏付けた。
  • IWSLT’14 De-Enの学習曲線では、EA-Transformer-Liteは、1イタレーションあたり3%のFLOPs増加にもかかわらず、vanilla Transformer-Liteよりも収束が早く、より低い訓練損失と高いBLEUスコアを達成した。
  • 可視化結果から、EA-Transformerでは層を経るごとに注目マップがシャープになり、オブジェクトに特化したパターンへと進化しているのに対し、vanillaトランスフォーマーはぼんやりとした広範なパターンを生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。