Skip to main content
QUICK REVIEW

[論文レビュー] On Optimal Transformer Depth for Low-Resource Language Translation

Elan van Biljon, Arnu Pretorius|arXiv (Cornell University)|Apr 9, 2020
Natural Language Processing Techniques参考文献 11被引用数 20
ひとこと要約

本稿は、低資源ニューラル機械翻訳における最適なTransformerの深さを調査し、英語→セツワナ語、セペディ語、アフリカーンス語翻訳タスクにおいて、浅めから中程度の深さのモデル(エンコーダー3層、デコーダー3層)が、より深いモデル(12層)を上回ることを発見した。パラメータ数が少なく、学習時間も短いにもかかわらず、中程度の深さのモデルは英語→アフリカーンス語翻訳で72.43の新しいSOTA BLEUスコアを達成し、前回の最高スコアを2倍以上に上回った。

ABSTRACT

Transformers have shown great promise as an approach to Neural Machine Translation (NMT) for low-resource languages. However, at the same time, transformer models remain difficult to optimize and require careful tuning of hyper-parameters to be useful in this setting. Many NMT toolkits come with a set of default hyper-parameters, which researchers and practitioners often adopt for the sake of convenience and avoiding tuning. These configurations, however, have been optimized for large-scale machine translation data sets with several millions of parallel sentences for European languages like English and French. In this work, we find that the current trend in the field to use very large models is detrimental for low-resource languages, since it makes training more difficult and hurts overall performance, confirming previous observations. We see our work as complementary to the Masakhane project ("Masakhane" means "We Build Together" in isiZulu.) In this spirit, low-resource NMT systems are now being built by the community who needs them the most. However, many in the community still have very limited access to the type of computational resources required for building extremely large models promoted by industrial research. Therefore, by showing that transformer models perform well (and often best) at low-to-moderate depth, we hope to convince fellow researchers to devote less computational resources, as well as time, to exploring overly large models during the development of these systems.

研究の動機と目的

  • Transformerの深さが低資源ニューラル機械翻訳における性能に与える影響を調査すること。
  • 大規模なモデルが最適化が困難である低資源設定において、非常に深いTransformerを用いるという一般的な傾向に挑戦すること。
  • 低資源言語対において、性能と計算効率のバランスを取れる最適な深さ範囲を特定すること。
  • ドロップアウトを伴うReLUネットワークにおける信号伝播の理論的洞察(Schoenholz et al., 2016; Pretorius et al., 2018)を基に、深層アーキテクチャにおける安定した情報伝達の制限要因を理論的に裏付けること。
  • 低資源コミュニティの計算負担を軽減するため、より小さく効率的なモデルを低資源NMTで推奨すること。

提案手法

  • 英語→セツワナ語、セペディ語、アフリカーンス語翻訳タスクにおいて、浅め(2層)、中程度(6層)、深め(12層)の3種類のTransformerバリアントを学習した。
  • Martinus & Abbott (2019) が前処理を施したAutshumatoデータセットを用い、先行研究と比較可能性を確保した。
  • マルチヘッドアテンション、フィードフォワードネットワーク、層正則化を施した残差接続といった、標準的なTransformerの構成要素を採用した。
  • ドロップアウトとReLU活性化関数を、元のTransformerアーキテクチャと同一の方法で全層に適用した。
  • BLEUスコアの比較を通じて、深さの違いに起因する性能のトレードオフを評価するためのアブレーションスタディを実施した。
  • 信号伝播の理論的洞察(Schoenholz et al., 2016; Pretorius et al., 2018)を基に、深さ選択を支援した。

実験結果

リサーチクエスチョン

  • RQ1Transformerの深さを増すことで、低資源ニューラル機械翻訳における性能が向上するか?
  • RQ2性能と学習安定性のバランスを取る上で、低資源設定におけるTransformerモデルに最適な深さ範囲は存在するか?
  • RQ3標準の12層構成よりも、浅めまたは中程度の深さのTransformerが、低資源翻訳タスクで優れた性能を示せるか?
  • RQ4ドロップアウトを伴うReLUネットワークにおける理論的信号伝播制約が、Transformerにおける有効な深さにどれほど制限を及えるか?
  • RQ5より小さなモデルは、計算コストを抑えながらも、低資源NMTでSOTA性能を達成できるか?

主な発見

  • 中程度の深さモデル(エンコーダー3層、デコーダー3層)は、英語→アフリカーンス語翻訳で72.43の新しいSOTA BLEUスコアを達成し、前回の最高スコア35.26を2倍以上に上回った。
  • 中程度の深さモデルは、英語→セツワナ語(30.49 BLEU 対 28.07)および英語→アフリカーンス語翻訳タスクの両方で、以前のベースラインを上回った。
  • パラメータ数を約半分に抑え、学習時間も短くしたにもかかわらず、3つの低資源言語対のうち2つにおいて、中程度の深さモデルが優れた性能を示した。
  • 深層モデル(12層)は、3つのタスクすべてにおいて中程度の深さモデルを下回り、深さの増加が低資源設定では有害であることが示された。
  • セペディ語翻訳のモデルは、以前のベースラインより性能が悪かったが、ベースラインの再現を試みた結果も同様の性能であったため、データやハイパーパrameterへの感受性が原因である可能性がある。
  • ドロップアウトとReLU活性化関数による信号劣化が、非常に深いTransformerにおける安定した情報伝達を制限するという仮説を、結果が裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。