Skip to main content
QUICK REVIEW

[論文レビュー] Training Deeper Neural Machine Translation Models with Transparent Attention

Ankur Bapna, Mia Xu Chen|arXiv (Cornell University)|Aug 22, 2018
Natural Language Processing Techniques参考文献 26被引用数 16
ひとこと要約

本論文では、デコーダーが上位層のみでなく、すべてのエンコーダー層出力の重み付き組み合わせに注目できるようにすることで、深層ニューラル機械翻訳モデルにおける勾配フローを向上させる手法「トランスペアントアテンション」を提案する。この手法により、20層までの深層TransformerおよびBi-RNNエンコーダーの成功した訓練が可能となり、WMT’14 En→DeおよびWMT’15 Cs→Enベンチマークで一貫して0.7–1.1 BLEUの向上が達成され、最適化の安定性と深層モデルの性能が向上する。

ABSTRACT

While current state-of-the-art NMT models, such as RNN seq2seq and Transformers, possess a large number of parameters, they are still shallow in comparison to convolutional models used for both text and vision applications. In this work we attempt to train significantly (2-3x) deeper Transformer and Bi-RNN encoders for machine translation. We propose a simple modification to the attention mechanism that eases the optimization of deeper models, and results in consistent gains of 0.7-1.1 BLEU on the benchmark WMT'14 English-German and WMT'15 Czech-English tasks for both architectures.

研究の動機と目的

  • 12層を超えるような極めて深いニューラル機械翻訳モデルの訓練という課題に対処すること。標準のアテンション機構では12層を超えると勾配フローが悪いため失敗する。
  • アテンション機構を変更することで、すべてのエンコーダー層に直接の勾配パスを提供し、深層TransformerおよびBi-RNNエンコーダーにおける最適化の安定性を向上させること。
  • 幅広いモデルと比較して、より深いアーキテクチャが翻訳性能を向上させられるかどうかを調査すること。
  • 強化された勾配フローが、標準的なNMTベンチマークで一貫した性能向上をもたらすことを検証すること。

提案手法

  • Nがエンコーダー層数、Mがデコーダーのアテンションモジュール数である( N+1 )×Mの可学習重み行列Wを導入し、すべてのエンコーダー層にわたるアテンション重みを割り当てる。
  • 各アテンションヘッドjおよび層iに対して、s_{i,j} = exp(W_{i,j}) / Σ_k exp(W_{k,j}) として、重みWにソフトマックス正規化を適用し、アテンション分布を生成する。
  • すべての層iにわたるエンコーダー隠れ状態h^i_tの重み付き組み合わせz^j_t = Σ_i s_{i,j} h^i_t を計算し、デコーダーが上位層のみに注目するのではなく、これを注目対象とする。
  • RNMT+の元のアーキテクチャとの互換性を維持するために、重み付き組み合わせにプロジェクションを適用する。
  • 学習中に重み行列Wにドロップアウトを適用し、学習の安定化とアテンション重みへの過学習の防止を図る。
  • 8台のP100 GPUで同期勾配更新を実行し、Adam最適化法を用いて、サブワードトークン化と共有32kボキャブラリーを用いた標準のWMT’14およびWMT’15データセットでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1標準のアテンション機構が12層を超えて失敗する状況下でも、深層TransformerおよびBi-RNNエンコーダーを成功裏に訓練できるか?
  • RQ2すべてのエンコーダー層にわたる重み付きで可学習のアテンション機構を導入することで、深層モデルにおける勾配フローと最適化の安定性が向上するか?
  • RQ3トランスペアントアテンションを用いたより深いモデルは、標準的な広いモデルと比較して、翻訳品質およびパラメータ効率の面でどれほど優れているか?
  • RQ4訓練中にアテンション重みの分布はどのように変化するか?また、これはエンコーダー層間でアンサンブルに類似した挙動を示すか?

主な発見

  • ヴァニラなTransformerモデルでは12層以上のエンコーダー層を用いた訓練に失敗するが、トランスペアントアテンションを用いることで、最大20層のエンコーダー層の訓練が成功する。
  • トランスペアントアテンションは、WMT’14 En→DeおよびWMT’15 Cs→Enの翻訳タスクにおいて、すべての深さ設定で一貫して0.7–1.1 BLEUポイントの向上を達成する。
  • 20層のエンコーダーとトランスペアントアテンションを備えたモデルは、モデル容量が半分未満の標準Transformer Bigよりも優れた性能を示す。
  • アテンション重みs_{i,j}は、訓練の初期段階では埋め込み層や初期層がより高い注目度を獲得するが、訓練が進むにつれて深い層(例:16層および20層)が注目度を高めるようになる。これは動的な特徴統合を示唆している。
  • 勾配ノルム比(r_t)のプロットから、トランスペアントアテンションが訓練ダイナミクスを安定化させ、良好に訓練されたRNMT+モデルに類似した挙動を示し、勾配消失効果を軽減することがわかる。
  • 性能向上の一部は、アテンションにより複数のエンコーダー層の表現が動的に統合される、暗黙のアンサンブル効果に起因すると考えられる。これはBERTのようなモデルにおけるコンテキストに依存する埋め込みと類似している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。