Skip to main content
QUICK REVIEW

[論文レビュー] Pay Better Attention to Attention: Head Selection in Multilingual and Multi-Domain Sequence Modeling

Hongyu Gong, Yun Tang|arXiv (Cornell University)|Jun 21, 2021
Topic Modeling参考文献 35被引用数 5
ひとこと要約

本論文は、多言語および多ドメインの系列モデル化を改善するため、マルチヘッドアテンションにおける選択的パラメータ共有を可能にする、サブセット戦略およびグループ戦略という、適応的アテンションヘッド選択戦略を提案する。言語やドメイン間でどのヘッドを共有すべきかを学習することで、干渉を低減しつつ特化性を維持し、音声認識、テキスト対テキスト、音声対テキスト翻訳の各タスクで一貫した向上を達成した。特に多言語音声対テキスト翻訳では、最大+2.0 BLEUの向上を達成した。

ABSTRACT

Multi-head attention has each of the attention heads collect salient information from different parts of an input sequence, making it a powerful mechanism for sequence modeling. Multilingual and multi-domain learning are common scenarios for sequence modeling, where the key challenge is to maximize positive transfer and mitigate negative transfer across languages and domains. In this paper, we find that non-selective attention sharing is sub-optimal for achieving good generalization across all languages and domains. We further propose attention sharing strategies to facilitate parameter sharing and specialization in multilingual and multi-domain sequence modeling. Our approach automatically learns shared and specialized attention heads for different languages and domains to mitigate their interference. Evaluated in various tasks including speech recognition, text-to-text and speech-to-text translation, the proposed attention sharing strategies consistently bring gains to sequence models built upon multi-head attention. For speech-to-text translation, our approach yields an average of $+2.0$ BLEU over $13$ language directions in multilingual setting and $+2.0$ BLEU over $3$ domains in multi-domain setting.

研究の動機と目的

  • マルチヘッドアテンションにおける非選択的パラメータ共有が引き起こす多言語および多ドメインの系列モデル化における干渉を解消すること。
  • データ駆動型の動的選択により、共有アテンションヘッドを柔軟に制御することで、多様な言語およびドメイン間での一般化と知識の転送を向上させること。
  • 軽量で効率的なアテンションヘッド共有戦略により、負の転送を軽減しつつ、言語およびドメイン固有性を維持すること。
  • 音声認識、テキスト対テキスト、音声対テキスト翻訳を含む、多様な系列モデル化タスクにおいて、提案手法の評価を実施すること。
  • 計算コストを犠牲にすることなく、低リソースおよび高リソース環境の両方で一貫したパフォーマンス向上を示すこと。

提案手法

  • 言語やドメイン間で共有されるアテンションヘッドを制御するため、サブセット戦略およびグループ戦略という2つのアテンションヘッド選択戦略を導入する。
  • Transformerベースのモデルのエンコーダおよびデコーダの両層に、これらの戦略を適用し、各レイヤーで共有ヘッドまたは特化ヘッドを個別に選択可能にする。
  • 各言語やドメインに対してどのヘッドがアクティブになるかを決定する学習可能なゲーティング機構を採用し、トレーニング中に動的に適応可能にする。
  • 計算オーバーヘッドが著しく増加しないように、軽量な設計とし、標準的なマルチヘッドアテンションとの互換性を維持する。
  • 標準的なバックプロパゲーションを用いて、共有ヘッドと特化ヘッドを併用してモデルを学習し、アテンションヘッド選択をエンドツーエンドで学習する。
  • アテンションヘッドの負荷分布を可視化し、言語やモデルレイヤー間での共有パターンとバランスを分析する。

実験結果

リサーチクエスチョン

  • RQ1選択的アテンションヘッド共有は、多言語および多ドメインの系列モデル化において、どのようにパフォーマンスに影響を与えるか?
  • RQ2アテンションヘッド選択戦略は、性質の異なる言語やドメイン間の干渉を低減しつつ、知識転送を維持できるか?
  • RQ3エンコーダとデコーダのどちらにアテンション選択を適用するかが、モデルパフォーマンスに与える影響は何か?
  • RQ4高リソース言語と低リソース言語において、共有ヘッドの数などの共有パターンはどのように異なるか?
  • RQ5異なる選択戦略下でのアテンションヘッド負荷分布は、どれほどバランスが取れているか?

主な発見

  • 提案されたアテンションヘッド選択戦略は、多言語音声認識および音声対テキスト翻訳を含む、複数の系列モデル化タスクで一貫したパフォーマンス向上を達成した。
  • 多言語音声対テキスト翻訳では、13の言語方向で平均+2.0 BLEUの向上を達成し、強力な正の転送効果を示した。
  • 多ドメイン音声対テキスト翻訳では、3つのドメインで+2.0 BLEUの向上を示し、ドメイン一般化への有効性を確認した。
  • エンコーダおよびデコーダの両方にアテンション選択を適用すると、片方での適用よりも優れたパフォーマンスを達成した。特に、多言語ASRではエンコーダのみに適用した場合が、デコーダのみに適用した場合を上回った。
  • 高リソースのヨーロッパ諸語(例:イタリア語、フランス語)は十分なデータがあるため、アテンションヘッドの共有数が少なく、干渉が低減される。一方、低リソース言語は高リソース言語と共有することで恩恵を受ける。
  • グループ戦略は、特にエンコーダおよびデコーダの中層部において、サブセット戦略よりもアテンションヘッドの負荷分布がよりバランスが取れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。