Skip to main content
QUICK REVIEW

[論文レビュー] Improving Deep Transformer with Depth-Scaled Initialization and Merged Attention

Biao Zhang, Ivan Titov|arXiv (Cornell University)|Aug 29, 2019
Natural Language Processing Techniques参考文献 35被引用数 5
ひとこと要約

本稿では、深層Transformerモデルにおける学習安定性と効率性を向上させるために、深さスケール初期化(DS-Init)と統合注意サブレイヤー(MAtt)を提案する。DS-Initは層の深さに応じて初期重みの分散をスケーリングすることで勾配消失を軽減する。一方、MAttは平均ベースの自己注意とエンコーダ-デコーダ注意を統合し、並列計算を可能にする。12層モデルを用いた5つの翻訳タスクにおいて平均で+1.1 BLEUの向上を達成したが、より深い構造であるにもかかわらずベースラインと同等のデコード速度を維持した。

ABSTRACT

The general trend in NLP is towards increasing model capacity and performance via deeper neural networks. However, simply stacking more layers of the popular Transformer architecture for machine translation results in poor convergence and high computational overhead. Our empirical analysis suggests that convergence is poor due to gradient vanishing caused by the interaction between residual connections and layer normalization. We propose depth-scaled initialization (DS-Init), which decreases parameter variance at the initialization stage, and reduces output variance of residual connections so as to ease gradient back-propagation through normalization layers. To address computational cost, we propose a merged attention sublayer (MAtt) which combines a simplified averagebased self-attention sublayer and the encoderdecoder attention sublayer on the decoder side. Results on WMT and IWSLT translation tasks with five translation directions show that deep Transformers with DS-Init and MAtt can substantially outperform their base counterpart in terms of BLEU (+1.1 BLEU on average for 12-layer models), while matching the decoding speed of the baseline model thanks to the efficiency improvements of MAtt.

研究の動機と目的

  • 学習中に勾配消失が生じるため、深さを増したTransformerモデルの収束不良を解消すること。
  • モデル性能を損なわず、深層Transformerの計算コストを低減すること。
  • 構造的および初期化の変更を通じて、学習の安定性と効率性を向上させること。
  • より深いTransformerアーキテクチャが、翻訳タスクにおいて標準の6層モデルを上回ることを可能にすること。
  • モデルの深さを増やしても、デコード速度を維持すること。

提案手法

  • 深さスケール初期化(DS-Init)は、層の深さ$l$を用いて初期重みの分散を$1/\sqrt{l}$の要因でスケーリングすることで、残差接続の出力分散を低減する。
  • 統合注意サブレイヤー(MAtt)は、簡略化された平均ベースの自己注意メカニズムと標準のエンコーダ-デコーダ注意を1つのサブレイヤーに統合し、並列計算を可能にする。
  • 簡略化された平均ベースの注意は、線形変換の数を減らし、パラメータ数と計算コストを低減する。
  • 本手法は残差接続と層正則化の構造を保持するが、初期化段階での分散制御により勾配の流れを安定化させる。
  • 実験ではAdam最適化法と標準の学習スケジュールを用い、WMTおよびIWSLT翻訳ベンチマークでモデルを評価した。
  • 低リソースタスク(例:IWSLT14 De-En)では、ドロップアウト率を増加(dp_a=0.3, dp_r=0.5)して訓練した。

実験結果

リサーチクエスチョン

  • RQ1なぜ深層Transformerはモデルの深さを増やしても収束しないのか?
  • RQ2残差接続と層正則化の相互作用が勾配消失にどのように寄与しているのか?
  • RQ3構造的変更なしに初期化の工夫だけで勾配消失を軽減できるか?
  • RQ4性能や速度を損なわず、深層Transformerの計算コストを低減できるか?
  • RQ5注意サブレイヤーの統合は、系列変換タスクにおける学習効率とモデル品質を向上させるか?

主な発見

  • DS-InitとMAttを用いた深層Transformerは、5つの翻訳タスクにおいて12層モデルで平均で+1.1 BLEUの向上を達成した。
  • 評価されたWMTおよびIWSLTタスクすべてで、ベースラインの6層Transformerを上回り、大多数の翻訳方向で1.0 BLEU以上の向上を示した。
  • WMT18 Zh-Enでは、透明モデル(Bapna et al., 2018)—深層エンコーダーの強力なベースライン—に対して+1.58 BLEUの向上を達成した。
  • MAttの効率性のおかげで、訓練時間は50%以上増加したが、デコード速度はベースラインと同等だった。
  • IWSLT14 De-Enタスクでは、chrFスコアで0.6ポイントの向上を達成し、より良いサブワードレベルのアライメントを示した。
  • 勾配ノルム解析の結果、DS-Initは学習ダイナミクスを安定化させ、特に初期学習段階でエンコーダーおよびデコーダー両層の勾配消失を低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。