Skip to main content
QUICK REVIEW

[論文レビュー] Language-Family Adapters for Low-Resource Multilingual Neural Machine Translation

Alexandra Chronopoulou, Dario Stojanovski|arXiv (Cornell University)|Sep 30, 2022
Natural Language Processing Techniques被引用数 4
ひとこと要約

本稿では、低資源多言語ニューラル機械翻訳(NMT)のための言語系列アダプタを提案する。mBART-50のバックボーンを凍結したまま、言語的に関連する言語群(例:バルト=スラブ語族、インド・イラン語族)に対して軽量なアダプタを訓練する。この手法は、言語ペアアダプタに対して+1.0 BLEU、言語に依存しないアダプタに対して+2.7 BLEUのスコア向上を達成し、パラメータ数の20%未満で、言語間の類似性を活用することで、未学習言語へのゼロショット転送性能を向上させる。

ABSTRACT

Large multilingual models trained with self-supervision achieve state-of-the-art results in a wide range of natural language processing tasks. Self-supervised pretrained models are often fine-tuned on parallel data from one or multiple language pairs for machine translation. Multilingual fine-tuning improves performance on low-resource languages but requires modifying the entire model and can be prohibitively expensive. Training a new adapter on each language pair or training a single adapter on all language pairs without updating the pretrained model has been proposed as a parameter-efficient alternative. However, the former does not permit any sharing between languages, while the latter shares parameters for all languages and is susceptible to negative interference. In this paper, we propose training language-family adapters on top of mBART-50 to facilitate cross-lingual transfer. Our approach outperforms related baselines, yielding higher translation scores on average when translating from English to 17 different low-resource languages. We also show that language-family adapters provide an effective method to translate to languages unseen during pretraining.

研究の動機と目的

  • 既存のアダプタ手法を超えるパラメータ効率の良いファインチューニングを可能にするために、低資源多言語ニューラル機械翻訳(NMT)の課題に取り組む。
  • すべての言語に共通のアダプタを訓練するのではなく、言語の言語的類似性に基づいて言語をグループ化することで、パラメータ効率の良い適応における負の干渉を低減する。
  • 言語系列内での共有される多言語的表現を活用することで、mBART-50の事前学習時に含まれなかった言語に対しても、効果的なゼロショット翻訳を可能にする。
  • 多言語NMTにおけるアダプタ訓練において、言語学的知識に基づくグループ化が、表現に基づくクラスタリング(例:GMM)よりも優れているかどうかを評価する。
  • 変換器アーキテクチャ内に埋め込み層アダプタを挿入することで、語彙レベルの情報を符号化する効果を評価する。

提案手法

  • mBART-50モデルを凍結した上で、特定の言語系列(例:インド・イラン語族、ミクロネシア語族)の並列単語対データを用いて言語系列アダプタを訓練する。
  • 言語学的知識ベース(例:Glottolog)を用いて、共通する文法的・音声的特徴に基づいて言語をグループ化する。モデルが導出した表現ではなく、言語学的根拠に基づく。
  • 変換器のエンコーダーおよびデコーダー層にアダプタモジュールを挿入し、各言語系列ごとに別個のアダプタを用意することで、パラメータ効率の良いファインチューニングを実現する。
  • 二段階の訓練プロセスを採用:第一段階では、それぞれの言語系列の並列データを用いて言語系列アダプタを訓練。第二段階では、学習済み言語および未学習言語の両方で評価を実施。
  • 比較のため、多言語文表現にGaussian Mixture Model(GMM)を適用し、言語をクラスタリングする。
  • アブレーションスタディを実施し、埋め込み層アダプタの貢献度および異なるクラスタリング戦略が翻訳性能に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1言語的グループ化に基づくアダプタ訓練は、言語ペアアダプタや言語に依存しないアダプタと比較して、低資源言語の翻訳性能を向上させるか?
  • RQ2言語系列アダプタは、mBART-50の事前学習時に含まれなかった言語に対しても、知識を効果的に転送できるか?
  • RQ3翻訳品質およびロバストネスの観点から、言語学的グループ化と表現に基づくクラスタリング(例:GMM)のどちらが優れているか?
  • RQ4語彙レベルの情報をモデルに符号化する埋め込み層アダプタの貢献度は何か?
  • RQ5本手法は、すべての言語に共通のアダプタを用いる場合と比較して、負の干渉をどの程度低減できるか?

主な発見

  • 言語系列アダプタは、OPUS-100に含まれる16の低資源言語ペアにおいて、言語ペアアダプタに対して+1.0 BLEU、言語に依存しないアダプタに対して+2.7 BLEUのスコア向上を達成した。
  • 本手法は全言語系列で両ベースラインを上回り、ミクロネシア語族およびインド・イラン語族では+2.0 BLEUを超える向上を示した。
  • mBART-50の事前学習データに含まれない未学習言語に対しても、言語系列アダプタは両ベースラインを著しく上回り、効果的なゼロショット転送を示した。
  • 言語に依存しないアダプタベースラインは、特に未学習言語において、関係のない言語クラスタからの負の干渉のため、両アダプタベースラインより性能が劣った。
  • アブレーションスタディの結果、埋め込み層アダプタの挿入により性能が向上したことが示され、語彙レベルの情報が低資源翻訳に有益であることが明らかになった。
  • 言語学的知識に基づくグループ化は、多言語文表現にGMMを適用したクラスタリングよりも一貫して優れた性能を示し、アダプタ設計における分野特化型言語構造の価値を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。