Skip to main content
QUICK REVIEW

[論文レビュー] Alleviating the Inequality of Attention Heads for Neural Machine Translation

Zewei Sun, Shujian Huang|arXiv (Cornell University)|Sep 21, 2020
Multimodal Machine Learning Applications参考文献 21被引用数 6
ひとこと要約

本稿では、バックプロパゲーション中に注意ヘッドをランダムまたは戦略的にマスクすることで、Transformerベースのニューラル機械翻訳における注意ヘッドの不均衡を軽減する訓練手法HeadMaskを提案する。実験の結果、複数の言語対で翻訳性能が向上し、ヘッド重要度のばらつきが低減され、モデルの頑健性が向上した。これは、バランスの取れたヘッド訓練がモデル容量と一般化性能を向上させることを確認している。

ABSTRACT

Recent studies show that the attention heads in Transformer are not equal. We relate this phenomenon to the imbalance training of multi-head attention and the model dependence on specific heads. To tackle this problem, we propose a simple masking method: HeadMask, in two specific ways. Experiments show that translation improvements are achieved on multiple language pairs. Subsequent empirical analyses also support our assumption and confirm the effectiveness of the method.

研究の動機と目的

  • Transformerモデルにおける注意ヘッド重要度の不均衡を調査し、その解決を図ること。
  • 訓練の不均衡が特定のヘッドが優位になり、他のヘッドが未利用化される原因となるという仮説を検証すること。
  • すべての注意ヘッドに均等に学習が行われるよう訓練手法を設計すること。
  • 実験的に、ヘッド依存性を低減させることでモデルの頑健性と翻訳品質が向上することを検証すること。

提案手法

  • 各訓練バッチで部分的な注意ヘッドをランダムに選択しマスクするマスクベースの訓練手法HeadMaskを提案する。
  • 重要度の高いヘッドを最初にマスクすることで、負担を弱いヘッドに再分配するバリエーションを導入する。
  • パrameterの更新なしにバックプロパゲーションによる勾配に基づく重要度推定を実施し、重要なヘッドを特定する。
  • フォワードおよびバックワードパス中にヘッドマスクを適用し、マスクされていないヘッドのみを更新することで、バランスの取れた学習を強制する。
  • 二段階プロセスを採用する:まず損失と勾配を計算し更新は行わない。次に、上位活性化ヘッドをマスクした後、最終的なパrameter更新を実行する。
  • ヘッド重要度を評価するために、損失に対するヘッド削除の感度を測定するためのテイラー近似法を用いる。

実験結果

リサーチクエスチョン

  • RQ1翻訳過程において、Transformerにおける注意ヘッドの重要度はどの程度不均衡であるか?
  • RQ2注意ヘッドの訓練の不均衡が、少数の重要なヘッドに依存するモデルを生じさせるか?
  • RQ3訓練中にマスク戦略を適用することで、ヘッド重要度のばらつきを低減し、全体の性能を向上させられるか?
  • RQ4特定のヘッドへの依存性を低減させることで、モデルの頑健性と一般化性能が向上するか?
  • RQ5ランダムマスクと重要度ベースマスクのどちらの戦略が、より優れた翻訳品質とヘッドバランスをもたらすか?

主な発見

  • Random-18マスクは、ベースラインと比較して、Zh→Enで+0.42 BLEU、Ro→Enで+0.87 BLEU、Tr→Enで+0.79 BLEUの向上を達成した。
  • Impt-18はRo→Enで最高の結果を記録し、+0.78 BLEUの向上を達成したが、他の言語対ではRandom-18に劣った。
  • 両方のHeadMaskバリエーションとも、ヘッド重要度の分散を顕著に低減した。特にZh→Enでは、Impt-18が分散を9.13(ベースラインの77.28)まで低減した。
  • すべての言語対で平均ヘッド重要度が低下し、個々のヘッドへのモデル依存性が減少した。
  • HeadMaskで訓練されたモデルは、推論時に重要なヘッドをマスクしても性能を維持するなど、より高い頑健性を示した。
  • 実験的分析により、訓練中に重要なヘッドをマスクすることで、ヘッド重要度分布がフラットになり、モデル挙動がよりバランスの取れたものになることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。