Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Data Augmentation for Low-Resource Translation

Mengzhou Xia, Xiang Kong|arXiv (Cornell University)|Jun 10, 2019
Natural Language Processing Techniques参考文献 33被引用数 8
ひとこと要約

本稿では、中間言語としての高リソース言語(HRL)を活用することで、低リソースニューラル機械翻訳のための一般化されたデータ拡張フレームワークを提案する。2段階のプロセスを用いる:まず、マッピングされた単語埋め込み空間から導出された二国語辞書を用いてHRL語の語を低リソース言語(LRL)語に置き換える。次に、非教師あり機械翻訳モデルを用いて出力を精錬する。本手法は、4つの低リソースデータセットにおいて、教師ありバックトランスレーションベースラインを1.5~8 BLEUポイント上回る翻訳品質向上を達成する。

ABSTRACT

Translation to or from low-resource languages LRLs poses challenges for machine translation in terms of both adequacy and fluency. Data augmentation utilizing large amounts of monolingual data is regarded as an effective way to alleviate these problems. In this paper, we propose a general framework for data augmentation in low-resource machine translation that not only uses target-side monolingual data, but also pivots through a related high-resource language HRL. Specifically, we experiment with a two-step pivoting method to convert high-resource data to the LRL, making use of available resources to better approximate the true data distribution of the LRL. First, we inject LRL words into HRL sentences through an induced bilingual dictionary. Second, we further edit these modified sentences using a modified unsupervised machine translation framework. Extensive experiments on four low-resource datasets show that under extreme low-resource settings, our data augmentation techniques improve translation quality by up to~1.5 to~8 BLEU points compared to supervised back-translation baselines

研究の動機と目的

  • 並列トレーニングデータが不足する低リソース言語(LRL)設定における翻訳品質の低さという課題に対処すること。
  • 関連する高リソース言語(HRL)からの単語彙と並列データを活用することで、データ効率を向上させること。
  • 辞書ベースの語置換と非教師あり機械翻訳を組み合わせた、より良いLRLデータ生成のための一般化されたデータ拡張戦略を開発すること。
  • 英語の単語彙データとHRL-英語並列データの両方を活用することで、極めて低リソースな状況下でも標準のバックトランスレーションベースラインを上回ること。

提案手法

  • マッピングされた単語埋め込み空間から導出された二国語辞書を用いて、LRL語をHRL文に挿入する。
  • 変更された非教師あり機械翻訳(m-UMT)フレームワークを適用し、置換された文をLRLでより自然で流暢に修正する。
  • 英語の単語彙データとHRL-英語並列データの両方を用いてデータ拡張を行い、二重のデータ拡張源を実現する。
  • 語のペア選択がモデル性能に与える影響を評価するため、双方向および単方向の辞書誘導手法を実装する。
  • 元のLRL-英語データと拡張されたLRL-英語データの両方を用いて、統合翻訳モデルを訓練することで一般化性能を向上させる。
  • 極めて低リソースな条件下で、4つの異なる低リソース言語対に対してフレームワークを評価する。

実験結果

リサーチクエスチョン

  • RQ1高リソース言語(HRL)を中間言語として用いることで、低リソース機械翻訳におけるデータ拡張が向上するか?
  • RQ2誘導された二国語辞書を用いた語の逐次置換は、HRLデータから現実的で自然なLRL文を生成するのにどの程度有効か?
  • RQ3辞書置換された文に対して非教師あり機械翻訳を適用することで、生成されたLRLデータの品質がどの程度向上するか?
  • RQ4英語の単語彙データとHRL-英語並列データの両方からの拡張を組み合わせることで、標準のバックトランスレーションよりも大きな向上が得られるか?
  • RQ5単方向と双方向の辞書誘導の選択が、最終的な翻訳性能にどのように影響するか?

主な発見

  • 提案された2段階のピボット手法は、極めて低リソースな状況下で、教師ありバックトランスレーションベースラインを1.5~8 BLEUポイント上回る翻訳品質向上を達成する。
  • 双方向辞書誘導手法は単方向誘導を上回る性能を示し、非対称な語のペアによるノイズが低減されるためと推測される。
  • 英語の単語彙データとHRL-英語並列データの両方からの拡張は、単一ソースからの拡張に比べて追加で1.1 BLEUポイントの向上をもたらす。
  • 本手法は、LRL語彙をHRL文に挿入することで、希少語の影響を顕著に軽減し、モデルの耐性を高める。
  • 非教師あり精錬ステップ(m-UMT)により、直接置換した場合に比べて、生成されたLRL文の流暢さと自然さが著しく向上する。
  • 本フレームワークは、4つの異なる低リソース言語対において一貫した向上を達成しており、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。