Skip to main content
QUICK REVIEW

[論文レビュー] Improving a Multi-Source Neural Machine Translation Model with Corpus Extension for Low-Resource Languages

GyuHyeon Choi, Jong-Hun Shin|arXiv (Cornell University)|Sep 26, 2017
Natural Language Processing Techniques参考文献 1被引用数 8
ひとこと要約

本稿では、合成データ生成を用いて訓練コーパスを拡張することで、低リソース言語対(特に朝鮮語-アラビア語および朝鮮語-ベトナム語)向けのマルチソースニューラル機械翻訳(NMT)を向上させる手法を提案する。合成されたソース文を生成することで翻訳品質が向上し、著者らはコーパス拡張がNMT性能を顕著に向上させることを実証した。さらに、マルチソースモデルと組み合わせることでさらなる向上が得られ、低リソース環境下で最先端の結果を達成した。

ABSTRACT

In machine translation, we often try to collect resources to improve performance. However, most of the language pairs, such as Korean-Arabic and Korean-Vietnamese, do not have enough resources to train machine translation systems. In this paper, we propose the use of synthetic methods for extending a low-resource corpus and apply it to a multi-source neural machine translation model. We showed the improvement of machine translation performance through corpus extension using the synthetic method. We specifically focused on how to create source sentences that can make better target sentences, including the use of synthetic methods. We found that the corpus extension could also improve the performance of multi-source neural machine translation. We showed the corpus extension and multi-source model to be efficient methods for a low-resource language pair. Furthermore, when both methods were used together, we found better machine translation performance.

研究の動機と目的

  • 低リソース言語対(特に朝鮮語-アラビア語および朝鮮語-ベトナム語)における並列訓練データの不足に対処すること。
  • 合成データ生成が、低リソースの単語対または並列コーパスを効果的に拡張し、NMT性能を向上させることの有効性を調査すること。
  • 低リソース翻訳におけるマルチソースNMTアーキテクチャと合成コーパス拡張の相乗効果を評価すること。
  • より高品質なターゲット翻訳をもたらす合成ソース文を生成する最適な戦略を特定すること。

提案手法

  • 著者らは、バックトランスレーションおよび言語モデリング技術を用いて、低リソースの並列コーパスを拡張するための合成ソース文を生成する。
  • 複数のソース入力を(例:単語対ソースおよび合成ソース)共同でエンコードするマルチソースNMTモデルを適用し、翻訳のなめらかさと正確性を向上させる。
  • モデルの信頼度とアライメントスコアに基づき、より良いターゲット翻訳を生み出す可能性の高い文構造を優先して合成データを生成する。
  • 実際の並列データと合成された並列文を組み合わせた訓練パイプラインを構築し、マルチソースNMTモデルをエンドツーエンドで微調整する。
  • 性能評価は、ホールドアウトされたテストセットにおけるBLEUスコアを用い、ベースライン、合成データのみ、マルチソースのみ、および両方の組み合わせの各アプローチを比較する。

実験結果

リサーチクエスチョン

  • RQ1合成データ生成は、低リソース並列コーパスを効果的に拡張し、ニューラル機械翻訳性能を向上させることができるか?
  • RQ2マルチソースNMTフレームワーク内での合成ソース文の統合が、ターゲット翻訳の品質にどのように影響するか?
  • RQ3マルチソースモデリングと合成コーパス拡張を組み合わせることで、単体での手法よりも優れた性能が得られるか?
  • RQ4どのような特徴を持つ合成ソース文が、より優れた翻訳出力をもたらすか?

主な発見

  • 合成データを用いたコーパス拡張により、低リソースの朝鮮語-アラビア語および朝鮮語-ベトナム語翻訳タスクにおいてBLEUスコアが顕著に向上した。
  • マルチソースNMTモデルは、単一ソースのベースラインを上回ったが、特に合成データ拡張と組み合わせた場合に顕著な向上を示した。
  • 合成コーパス拡張とマルチソースモデリングの両方を同時に適用した場合に最も高い性能が達成され、相乗効果が確認された。
  • 高い信頼度で生成され、ターゲット文と良好にアライメントされた合成文は、より正確な翻訳をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。