Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Sparse Transformer for Multilingual Translation

Hongyu Gong, Xian Li|arXiv (Cornell University)|Apr 15, 2021
Natural Language Processing Techniques参考文献 24被引用数 12
ひとこと要約

本稿では、多言語翻訳のための適応的でスパースなトランスフォーマー・アーキテクチャを提案する。このアーキテクチャは、干渉を低減しつつ知識の転送を可能にする言語固有のサブネットワークを学習する。入力言語ごとに適応的に選択された、アテンションヘッド、フィードフォワードブロック、および層のスケールでの細分化されたスパース性を適用することで、標準トランスフォーマーに比べて、1対多、多対1、ゼロショット翻訳タスクでそれぞれ+2.1、+1.3、+6.2 BLEUの向上を達成し、推論コストの増加なしに実現した。

ABSTRACT

Multilingual machine translation has attracted much attention recently due to its support of knowledge transfer among languages and the low cost of training and deployment compared with numerous bilingual models. A known challenge of multilingual models is the negative language interference. In order to enhance the translation quality, deeper and wider architectures are applied to multilingual modeling for larger model capacity, which suffers from the increased inference cost at the same time. It has been pointed out in recent studies that parameters shared among languages are the cause of interference while they may also enable positive transfer. Based on these insights, we propose an adaptive and sparse architecture for multilingual modeling, and train the model to learn shared and language-specific parameters to improve the positive transfer and mitigate the interference. The sparse architecture only activates a sub-network which preserves inference efficiency, and the adaptive design selects different sub-networks based on the input languages. Our model outperforms strong baselines across multiple benchmarks. On the large-scale OPUS dataset with $100$ languages, we achieve $+2.1$, $+1.3$ and $+6.2$ BLEU improvements in one-to-many, many-to-one and zero-shot tasks respectively compared to standard Transformer without increasing the inference cost.

研究の動機と目的

  • 知識の転送の利点があるにもかかわらず、性能の低下を引き起こす多言語ニューラル機械翻訳における言語干渉を解消すること。
  • パラメータ共有による高コストな計算負荷に苦しむ、深く広い多言語モデルにおける推論コストを低減すること。
  • 特定の言語ごとに、どのコンponents(例:アテンションヘッド、FFNブロック)を共有すべきか、または排他的にするかを学習することで、細分化されたパラメータ共有を可能にすること。
  • さまざまな言語スケールにおいて、アテンション、FFN、およびレイヤースパース性の異なるタイプの効果を比較すること。
  • 適応的かつ言語に依存するスパース性を用いて、推論効率を維持しながら翻訳品質を向上させること。

提案手法

  • 入力言語に基づいて言語固有のサブネットワークを活性化するように学習する潜在変数モデルを導入し、適応的スパース性を実現する。
  • アテンションヘッド、フィードフォワードネットワーク(FFN)ブロック、トランスフォーマー層の複数スケールにスパース性を適用し、各言語が自らのサブセットを選択する。
  • スパースルーティングを促進するためのtop-k損失と、過剰正則化を防ぐための乖離損失を用い、コンポONENTの使用をバランスさせる。
  • FFN重み行列をブロックに分割し、言語間で部分的な共有を可能にするとともに、特定の言語に排他的なアテンションヘッドを割り当て、言語固有性を保持する。
  • FFNおよびアテンションモジュールに、エキスパートの混合のようなルーティング機構を採用し、推論時に活性化されたサブコンponentのみが寄与する。
  • 微分可能なルーティングを用いてエンドツーエンドの学習を可能にし、スパース性パターンとモデルパラメータを同時に最適化できる。

実験結果

リサーチクエスチョン

  • RQ1多言語環境において、どのタイプのスパース性—アテンション、FFN、またはレイヤーレベル—が最高の翻訳パフォーマンスをもたらすか?
  • RQ2複数のスパース性タイプの組み合わせが、大規模な多言語翻訳タスクにおけるパフォーマンスにどのように影響するか?
  • RQ3言語の近縁性とリソース量の違いが、学習されたパラメータ共有パターンにどの程度影響を及えるか?
  • RQ4適応的で細分化されたスパース性は、推論コストを増加させることなく翻訳品質を向上させることができるか?
  • RQ5モデルが学習するスパース性パターンは、言語間の言語的関係やリソース格差をどのように反映しているか?

主な発見

  • 100言語を含むOPUS-100データセットにおいて、標準トランスフォーマーに比べて、1対多、多対1、ゼロショット翻訳タスクでそれぞれ+2.1、+1.3、+6.2 BLEUの向上を達成した。
  • 各入力言語に対してのみサブネットワークを活性化することで、計算コストの増加なしに推論効率を維持した。
  • 24言語の中規模翻訳タスクでは、1対多翻訳においてFFNスパース性が最も高い向上をもたらしたが、多対1翻訳ではアテンションスパース性が最良のパフォーマンスを示した。
  • 大規模なOPUS-100では、アテンション、FFN、およびレイヤースパース性のすべてのタイプを組み合わせることで、すべてのタスクで最適なパフォーマンスが得られた。
  • モデルが学習するスパース性パターンは、言語ファミリーとリソースサイズと相関しており、高リソース言語は低リソース言語とあまり共有しない傾向を示した。
  • モデルの性能はスパース性レベルに対して頑健である:スパース性損失を適用しなくても、BLEUスコアにわずか0.1の低下しか見られず、top-k損失が効果的にスパース性を維持していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。