Skip to main content
QUICK REVIEW

[論文レビュー] Multilingual Neural Machine Translation with Language Clustering

Xu Tan, Jiale Chen|arXiv (Cornell University)|Aug 25, 2019
Natural Language Processing Techniques参考文献 30被引用数 11
ひとこと要約

本稿では、類似言語を共有モデルにグループ化することで翻訳性能を向上させる、多言語ニューラル機械翻訳(NMT)のための言語クラスタリングフレームワークを提案する。言語系統に基づくクラスタリング(事前知識)とエンド・ツー・エンドで学習された言語埋め込みの両方を比較し、埋め込みベースのクラスタリングが言語的関係をよりよく捉え、23言語でBLEUスコアを向上させることを示している。

ABSTRACT

Multilingual neural machine translation (NMT), which translates multiple languages using a single model, is of great practical importance due to its advantages in simplifying the training process, reducing online maintenance costs, and enhancing low-resource and zero-shot translation. Given there are thousands of languages in the world and some of them are very different, it is extremely burdensome to handle them all in a single model or use a separate model for each language pair. Therefore, given a fixed resource budget, e.g., the number of models, how to determine which languages should be supported by one model is critical to multilingual NMT, which, unfortunately, has been ignored by previous work. In this work, we develop a framework that clusters languages into different groups and trains one multilingual model for each cluster. We study two methods for language clustering: (1) using prior knowledge, where we cluster languages according to language family, and (2) using language embedding, in which we represent each language by an embedding vector and cluster them in the embedding space. In particular, we obtain the embedding vectors of all the languages by training a universal neural machine translation model. Our experiments on 23 languages show that the first clustering method is simple and easy to understand but leading to suboptimal translation accuracy, while the second method sufficiently captures the relationship among languages well and improves the translation accuracy for almost all the languages over baseline methods

研究の動機と目的

  • 固定リソース予算下での多言語NMTにおける最適な言語グループ化の選定という課題に対処すること。
  • 言語系統(言語系統)に基づくクラスタリングと学習された言語埋め込みに基づくクラスタリングのどちらが翻訳性能に優れるかを調査すること。
  • 言語的に類似した言語を共有モデルにグループ化することで、低リソース言語およびゼロショット翻訳を改善すること。
  • 多言語翻訳タスクに整合したスケーラブルでエンド・ツー・エンドの言語クラスタリング手法を開発すること。

提案手法

  • 各言語の固有タグを用いてユニバーサルNMTモデルを学習し、言語埋め込みベクトルをエンド・ツー・エンドで学習する。
  • 学習された言語埋め込みを用いて、クラスタリングアルゴリズム(例:k-means)により埋め込み空間で言語をクラスタリングする。
  • 2つのクラスタリング戦略を比較する:(1) 言語系統(例:インド・ヨーロッパ語族の分岐)を用いた事前知識、(2) 学習された埋め込みを用いた非教師ありクラスタリング。
  • 各クラスタごとに別個の多言語NMTモデルを訓練し、各モデルがその言語グループ内の翻訳を処理する。
  • IWSLT 2011–2018データセットを用いて、23言語の多対一(ソース→英語)および一対多(英語→ターゲット)設定においてBLEUスコアで性能を評価する。
  • 埋め込みベースのアプローチにおける最適なクラスタ数を特定するために、エルボー法を適用し、一対多設定では5つのクラスタが最適であると判明した。

実験結果

リサーチクエスチョン

  • RQ1学習された埋め込みに基づくクラスタリングは、言語系統の知識に基づくクラスタリングを上回るのか?
  • RQ2言語埋め込みは、言語系統内の分岐や地域的影響といった微細な言語的関係を効果的に捉えられるか?
  • RQ3類似した言語をグループ化することで翻訳性能にどのような影響があるのか、特に低リソース言語においては?
  • RQ4多言語NMTにおける言語グループ化の最適なクラスタ数は何か、そしてどのように特定されるか?
  • RQ5提案手法は、数百または数千の言語を含むより大規模な多言語環境にもスケーラブルに適用可能か?

主な発見

  • ユニバーサルNMTモデルを用いて学習された言語埋め込みは、言語系統内の分岐といった微細な関係を含め、言語的類似性を効果的に捉えている。
  • 学習された埋め込みを用いてグループ化された言語は、言語系統に基づくクラスタリングよりも高いBLEUスコアを達成しており、クラスタリング品質の優位性が示された。
  • 埋め込みベースのクラスタリング手法は、言語系統ベースのベースラインおよび個別モデルよりも、いくつかの低リソース言語で優れた性能を示しており、データ効率の向上が裏付けられた。
  • クラスタリング結果は、中国語と日本語、タイ語とベトナム語のような地域的・歴史的影響を反映しており、埋め込みが系統に依存しない言語的関係を捉えていることが示された。
  • 一対多設定では、エルボー法を用いて最適なクラスタ数が5つと特定され、安定的でデータ駆動型のクラスタリング構成であることが示された。
  • 個別モデルは約10の言語で最高のBLEUスコアを記録しているが、学習データ量が少ない言語では、埋め込みベースのクラスタリング手法が個別モデルを著しく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。