Skip to main content
QUICK REVIEW

[論文レビュー] Bi-Directional Neural Machine Translation with Synthetic Parallel Data

Xing Niu, Michael Denkowski|arXiv (Cornell University)|May 29, 2018
Natural Language Processing Techniques参考文献 29被引用数 10
ひとこと要約

本稿では、モノリンガルコーパスから生成された合成並列データを用いて、片方向翻訳と双方向翻訳を同時に学習する双方向ニューラル機械翻訳モデルを提案する。1つのモデルで両方向の翻訳を実行し、バックトランスレーションによる反復的データ拡張を施すことで、低リソースおよびドメイン外設定において翻訳品質を向上させるとともに、単方向モデルと比較してトレーニングおよびデプロイコストを削減する。

ABSTRACT

Despite impressive progress in high-resource settings, Neural Machine Translation (NMT) still struggles in low-resource and out-of-domain scenarios, often failing to match the quality of phrase-based translation. We propose a novel technique that combines back-translation and multilingual NMT to improve performance in these difficult cases. Our technique trains a single model for both directions of a language pair, allowing us to back-translate source or target monolingual data without requiring an auxiliary model. We then continue training on the augmented parallel data, enabling a cycle of improvement for a single model that can incorporate any source, target, or parallel data to improve both translation directions. As a byproduct, these models can reduce training and deployment costs significantly compared to uni-directional models. Extensive experiments show that our technique outperforms standard back-translation in low-resource scenarios, improves quality on cross-domain tasks, and effectively reduces costs across the board.

研究の動機と目的

  • 並列データが乏しい低リソースおよびドメイン外翻訳シナリオにおけるNMTの性能ギャップを是正すること。
  • アーキテクチャの変更なしにモノリンガルデータを統合できる標準NMTモデルの限界を克服すること。
  • 1つのモデルに両翻訳方向を統合することで、トレーニングおよびデプロイコストを削減すること。
  • 両方の言語のモノリンガルコーパスから得た合成データを用いた反復的バックトランスレーションにより、翻訳品質を向上させること。
  • 性能向上を最大化するためのモノリンガルデータおよび合成データの組み合わせ選択のベストプラクティスを確立すること。

提案手法

  • 言語固有のトークン(例:$<$2en$>$)を用いて方向を示し、元のデータと入れ替えられたソース・ターゲット文のペアを含むバランスの取れたデータセット上で、1つのマルチリンガルNMTモデルをトレーニングする。
  • トレーニング済みの双方向モデルを用いて、モノリンガルのソースおよびターゲットデータを両方向の合成並列文に翻訳する。
  • 元の並列トレーニングデータに合成文ペアを追加し、同じモデルを継続的にトレーニングすることで、改善のサイクルを可能にする。
  • 語彙のサイズとモデルの複雑さを低減するため、ソース言語とターゲット言語間で語彙埋め込みを共有し、共通のバイトペア符号化(BPE)サブワード分割を用いる。
  • ドメイン内データに類似しているが一般ドメインのモノリンガルコーパスとは明確に異なる文を特定するために、交差エントロピー差分を用いて高品質なモノリンガルデータを選択する。
  • 実際のモノリンガルデータが合成データ生成時に常にターゲット側に現れるようにすることで、デコーダーのパラメータを凍結する必要なく、モデルの劣化を回避する。

実験結果

リサーチクエスチョン

  • RQ11つの双方向NMTモデルは、両方の言語のモノリンガルデータを有効に活用して翻訳品質を向上させることができるか?
  • RQ2合成データを用いた両方向の共同学習は、分離された逆方向モデルを用いた標準的なバックトランスレーションよりも、低リソース設定で優れた性能を示すか?
  • RQ3単方向モデルと比較して、このアプローチはどの程度トレーニングおよびデプロイコストを削減できるか?
  • RQ4現代英語から聖書的ヘブライ語への翻訳など、ドメイン跨ぎの翻訳タスクにおいて、この方法はどの程度効果的か?
  • RQ5合成データ拡張による利益を最大化するためのモノリンガルデータ選択の最適戦略は何か?

主な発見

  • 本手法は、増強データでのファインチューニング後、聖書翻訳タスクでBLEUスコアを70〜130%相対的に向上させたが、初期の非常に弱いベースラインから出発したにもかかわらず、その効果が顕著であった。
  • 標準的なバックトランスレーションよりも低リソース状況で優れた性能を示し、補助モデルを必要とせずに一貫した向上を達成した。
  • 現代英語から聖書的ヘブライ語への翻訳など、ドメイン外タスクにおいても翻訳品質が顕著に向上した。特に、未知語彙率が30%を超えた状況でも有効であった。
  • 両方の翻訳方向を1つのモデルに統合することで、トレーニングおよびデプロイコストを顕著に削減した。
  • 交差エントロピー差分を用いたモノリンガルデータ選択により、高品質なデータを特定でき、これがより良い合成データとモデル性能の向上に寄与した。
  • パrameterの凍結やアーキテクチャの変更なしに、両方のモノリンガルデータを効果的に活用できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。