Skip to main content
QUICK REVIEW

[論文レビュー] Improving Multilingual Neural Machine Translation For Low-Resource Languages: French,English - Vietnamese

Thi-Vinh Ngo, Phuong-Thai Nguyen|arXiv (Cornell University)|Dec 16, 2020
Natural Language Processing Techniques参考文献 23被引用数 7
ひとこと要約

本稿では、低資源のフランス語・ベトナム語および英語・ベトナム語対のための多言語ニューラル機械翻訳を改善する、2つのシンプルでアーキテクチャに依存しない手法を提案する。1つは共有多言語埋め込み空間における動的語類似度学習、もう1つは学習中に希少語の埋め込みにスカラー調整を挿入することである。この手法は二言語ベースラインに対して+2.54 BLEUポイントの向上を達成し、自己学習に基づく合成データ拡張による顕著な向上が得られた。

ABSTRACT

Prior works have demonstrated that a low-resource language pair can benefit from multilingual machine translation (MT) systems, which rely on many language pairs' joint training. This paper proposes two simple strategies to address the rare word issue in multilingual MT systems for two low-resource language pairs: French-Vietnamese and English-Vietnamese. The first strategy is about dynamical learning word similarity of tokens in the shared space among source languages while another one attempts to augment the translation ability of rare words through updating their embeddings during the training. Besides, we leverage monolingual data for multilingual MT systems to increase the amount of synthetic parallel corpora while dealing with the data sparsity problem. We have shown significant improvements of up to +1.62 and +2.54 BLEU points over the bilingual baseline systems for both language pairs and released our datasets for the research community.

研究の動機と目的

  • 低資源の多言語ニューラル機械翻訳システムにおける希少語翻訳の課題に対処すること。
  • 限定的な並列データを有するフランス語・ベトナム語および英語・ベトナム語対の翻訳品質を向上させること。
  • 自己学習を用いて単語彙データを活用し、合成並列コーパスを生成する有効性を検討すること。
  • モデルサイズの増加なしに、希少語表現を強化するための軽量でアーキテクチャに依存しない修正を開発すること。
  • 将来的な低資源NMT研究を支援するため、TEDトークスから得た新しい多言語データセットを公開すること。

提案手法

  • 多言語NMTシステムからのクロスリンガルアライメントを用いて、外部リソース(二語対訳辞書やWordNetなど)を必要とせずに、共有多言語埋め込み空間における語類似度を動的に学習する。
  • 頻出語へのモデルのバイアスを是正するために、学習中に希少語の埋め込みにスカラー調整を導入し、翻訳の可能性を向上させる。
  • 前方NMTモデルを用いて単語彙データのソース側を処理し、合成されたターゲット側翻訳を生成することで、単語彙データに対する自己学習を適用し、擬似並列データを生成する。
  • 反復的な学習を用いて、実際の並列データと合成並列データの両方で多言語モデルを微調整し、学習の安定化と一般化性能の向上を図る。
  • 低資源状況におけるデータスパarsityの緩和を図るため、TEDトークスドメインの単語彙データを活用して学習データ量を増加させる。
  • アーキテクチャの変更なしに、多言語Transformerベースのアーキテクチャをベースモデルとして用いることで、互換性とスケーラビリティを確保する。

実験結果

リサーチクエスチョン

  • RQ1共有多言語埋め込み空間における動的語類似度学習は、低資源NMTシステムにおける希少語翻訳を改善できるか?
  • RQ2モデルアーキテクチャの変更なしに、希少語の埋め込みにスカラー調整を挿入することで、翻訳品質に測定可能な向上が得られるか?
  • RQ3単語彙データに対する自己学習は、フランス語・ベトナム語や英語・ベトナム語のような低資源言語対の多言語NMT性能をどの程度向上できるか?
  • RQ4高資源言語対(例:フランス語)から得た合成データの導入は、低資源ターゲット言語対(例:ベトナム語)の性能にどのような影響を与えるか?
  • RQ5軽量で非パrametricな手法は、モデル効率を維持しながら、既存の手法を凌駆する希少語処理性能を達成できるか?

主な発見

  • 提案手法は、英語→ベトナム語翻訳タスクにおいて、二言語ベースラインに対して+2.54 BLEUポイントの向上を達成した。
  • フランス語→ベトナム語システムでは、+1.62 BLEUポイントの向上を達成し、両方の低資源対で一貫した改善が確認された。
  • 単語彙データに対する自己学習により、高品質な合成並列データが生成された。平均化モデルでは、1.2kサンプルの擬似並列セットが18.71 BLEUポイントを達成した。
  • 実データと合成データの両方で学習したシステムは、一般化性能が強く、特にフランス語→ベトナム語対で顕著な恩恵を受けていた。
  • 希少語の埋め込みへのスカラー調整により、特に初期学習段階で翻訳の可能性が顕著に向上した。
  • 研究者らは、TEDトークスドメインからの新しい多言語データセット(フランス語・ベトナム語および英語・ベトナム語の並列および単語彙データを含む)を公開した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。