Skip to main content
QUICK REVIEW

[論文レビュー] Why Deep Transformers are Difficult to Converge? From Computation Order to Lipschitz Restricted Parameter Initialization

Hongfei Xu, Qiuhui Liu|arXiv (Cornell University)|Nov 8, 2019
Natural Language Processing Techniques参考文献 10被引用数 8
ひとこと要約

この論文は、深層Transformerにおける残差接続とレイヤーノーマライゼーションの計算順序が最適化に顕著な影響を与えることを特定し、元の計算順序のままでも24層にまで到達可能な収束を可能にする、リプシッツ制約付きパラメータ初期化手法を提案している。これは、従来の研究がアーキテクチャの変更を要するか、深層エンコーダに限定して検討していた主な制限を克服するものである。

ABSTRACT

The Transformer translation model employs residual connection and layer normalization to ease the optimization difficulties caused by its multi-layer encoder/decoder structure. While several previous works show that even with residual connection and layer normalization, deep Transformers still have difficulty in training, and particularly a Transformer model with more than 12 encoder/decoder layers fails to converge. In this paper, we first empirically demonstrate that a simple modification made in the official implementation which changes the computation order of residual connection and layer normalization can effectively ease the optimization of deep Transformers. In addition, we deeply compare the subtle difference in computation order, and propose a parameter initialization method which simply puts Lipschitz restriction on the initialization of Transformers but can effectively ensure their convergence. We empirically show that with proper parameter initialization, deep Transformers with the original computation order can converge, which is quite in contrast to all previous works, and obtain significant improvements with up to 24 layers. Our proposed approach additionally enables to benefit from deep decoders compared to previous works which focus on deep encoders.

研究の動機と目的

  • 残差接続とレイヤーノーマライゼーションが存在するにもかかわらず、12層を超える深層Transformerが収束しない理由を調査すること。
  • 特に、残差接続とレイヤーノーマライゼーションの計算順序が最適化安定性に与える影響を分析すること。
  • 勾配の流れを制御し最適化を改善するために、モデル重みにリプシッツ制約を課すパラメータ初期化手法を開発すること。
  • 従来の研究がほとんど無視してきた深層デコーダーの学習を可能にするために、最小限のアーキテクチャ変更で収束を保証すること。

提案手法

  • 実験的に、レイヤーノーマライゼーションを残差接続よりも先に適用する計算順序の変更が、深層Transformerにおける学習安定性を顕著に向上させることを示した。
  • 勾配の流れを制御し最適化を改善するため、重み行列のスペクトルノルムに制約を課す、新たなパラメータ初期化スキームを提案した。
  • 前向き伝搬と自己注意サブレイヤーの重み行列のスペクトルノルムに制約を課すことで、リプシッツ制約付き初期化を定式化した。
  • 標準初期化との比較を通じて、深層エンコーダおよび深層デコーダを用いた機械翻訳ベンチマークで、提案手法の収束性と性能を評価した。
  • 除去実験を用いて、計算順序と初期化の影響を分離し、適切な初期化により、元の順序であっても収束を回復できることを示した。
  • 勾配ダイナミクスと損失推移を分析し、リプシッツ制約が深層ネットワークにおける学習を安定化させることを検証した。

実験結果

リサーチクエスチョン

  • RQ1残差接続とレイヤーノーマライゼーションの計算順序が、深層Transformerの最適化にどのように影響するか?
  • RQ2計算順序を変更せずに、リプシッツ制約付きパラメータ初期化手法が深層Transformerの学習を安定化させられるか?
  • RQ3提案された初期化手法は、従来の研究がほとんど検討してこなかった深層デコーダーに対しても収束を可能にするか?
  • RQ4提案手法を用いることで、モデルの深さ(例:24層)をどの程度まで増加させられ、収束性と性能を維持できるか?

主な発見

  • レイヤーノーマライゼーションを残差接続よりも先に適用するという、単純な計算順序の変更が、深層Transformerにおける学習安定性を顕著に向上させる。
  • 提案されたリプシッツ制約付き初期化により、元の計算順序を維持したまま、24層にまで到達する深層Transformerが成功裏に収束した。
  • 従来の研究がほとんど達成できなかった深層デコーダーの有効な学習を可能にし、深層エンコーダーにとどまらない広範な適用可能性を示した。
  • 機械翻訳ベンチマークにおいて、提案手法は標準初期化および従来の深層Transformerアプローチを上回る顕著な性能向上を達成した。
  • 実験的分析により、リプシッツ制約が勾配の流れを安定化させ、特に深層アーキテクチャにおいて損失の分散を低減することが示された。
  • 標準初期化では失敗する場合でも、24層を超えるモデルであっても、本手法により収束が達成された。これは、深層Transformerアーキテクチャにおける長年の学習困難を解決するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。