Skip to main content
QUICK REVIEW

[論文レビュー] Multi-branch Attentive Transformer

Fan Yang, Shufang Xie|arXiv (Cornell University)|Jun 18, 2020
Advanced Neural Network Applications参考文献 33被引用数 15
ひとこと要約

本稿では、複数の独立したマルチヘッドアテンションブランチの出力を平均化することで性能を向上させる、新しい変種であるマルチブランチアテンティブトランスフォーマー(MAT)を提案する。ドロップブランチ正則化と事前学習済み単一ブランチトランスフォーマーからのプロキシアル初期化を用いることで、機械翻訳、コード生成、自然言語理解のタスクにおいて顕著な向上を達成し、序列学習におけるマルチブランチアテンションの有効性を示している。

ABSTRACT

While the multi-branch architecture is one of the key ingredients to the success of computer vision tasks, it has not been well investigated in natural language processing, especially sequence learning tasks. In this work, we propose a simple yet effective variant of Transformer called multi-branch attentive Transformer (briefly, MAT), where the attention layer is the average of multiple branches and each branch is an independent multi-head attention layer. We leverage two training techniques to regularize the training: drop-branch, which randomly drops individual branches during training, and proximal initialization, which uses a pre-trained Transformer model to initialize multiple branches. Experiments on machine translation, code generation and natural language understanding demonstrate that such a simple variant of Transformer brings significant improvements. Our code is available at \url{https://github.com/HA-Transformer}.

研究の動機と目的

  • 自然言語処理におけるマルチブランチアーキテクチャの可能性、特に序列学習タスクにおける可能性を調査すること。
  • コンピュータビジョン分野で成功を収めたにもかかわらず、トランスフォーマーにおいてはマルチブランチ設計が十分に活用されていないという問題に取り組むこと。
  • 標準的なマルチヘッドアテンションを超えた構造的なアーキテクチャ拡張を通じて、モデルの一般化性能と性能を向上させること。
  • より深いマルチブランチトランスフォーマー変種を効果的に訓練するための技術——ドロップブランチとプロキシアル初期化——を開発すること。
  • 機械翻訳、コード生成、自然言語理解を含む多様なNLPベンチマークにおいて、MATの有効性を実証的に検証すること。

提案手法

  • MATは、標準的なマルチヘッドアテンションレイヤーを、複数の独立したマルチヘッドアテンションブランチに置き換え、その出力を平均化して最終出力とする。
  • MATの各ブランチは、入力クエリ、キー、バリューを共有するが、学習可能なパラメータが別々に存在する標準的なマルチヘッドアテンションレイヤーである。
  • トレーニング中にドロップブランチ正則化が適用され、個々のブランチがランダムに無効化されることで、共適応を防ぎ、一般化性能を向上させる。
  • プロキシアル初期化は、事前学習済みの単一ブランチトランスフォーマーを用いてMATの複数ブランチを初期化することで、トレーニングの安定化と収束の改善を図る。
  • アーキテクチャは、標準トランスフォーマーと同一の入力・出力次元を維持しており、直接的な比較や即時の差し替えが可能である。
  • 本手法は、各ヘッド内での連結とブランチ間での平均化の両方を活用し、マルチブランチアテンションメカニズムを構築している。

実験結果

リサーチクエスチョン

  • RQ1コンピュータビジョンからインspiredされたマルチブランチアテンションメカニズムは、機械翻訳やコード生成のような序列学習タスクにおいて性能を向上させ得るか?
  • RQ2ドロップブランチ正則化は、マルチブランチトランスフォーマーのトレーニング安定性と一般化性能にどのように影響するか?
  • RQ3事前学習済み単一ブランチトランスフォーマーからのプロキシアル初期化は、MATの収束性と性能を向上させるか?
  • RQ4マルチブランチアテンションによる性能向上はアテンションレイヤーに限定されるのか、それともフィードフォワードネットワークに対しても拡張可能か?
  • RQ5ブランチ数や隠れ層次元などのハイパーパrameterが、異なるNLPタスクにおけるMATの性能にどのように影響するか?

主な発見

  • MATは、機械翻訳タスクにおいて標準トランスフォーマーを顕著に上回り、IWSLT En→DeではBLEUスコアが最大0.60ポイント向上した。
  • IWSLT Fr→En翻訳タスクでは、3ブランチと1024のフィードフォワード次元を用いたMAT(プロキシアル初期化とドロップブランチを適用)が、ベースラインから1.33 BLEUポイント向上した。
  • ヘッドをランダムにドロップする(ドロップブランチの一種として)アプローチでは、4ブランチと2048のフィードフォワード次元を用いた場合、IWSLT En→Frで0.48 BLEUポイントの向上を達成した。
  • コード生成タスクへの適用においても、MATは標準トランスフォーマーを上回り、多様なNLPタスクにおいて一貫した向上を示した。
  • 研究では、フィードフォワードネットワークに複数のブランチを導入すると性能がわずかに低下することが判明し、マルチブランチ設計がアテンションレイヤーで最も効果的であることが示された。
  • プロキシアル初期化は、評価されたすべての設定でMATの性能を向上させ、タスクや構成に応じて0.15〜1.33 BLEUポイントの向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。