Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation for Neural Machine Translation using Generative Language Model

Seok Jin Oh, Su ah Lee|arXiv (Cornell University)|Jul 26, 2023
Natural Language Processing TechniquesComputer Science被引用数 3
ひとこと要約

本稿では、GPT-3.5-turboを用いて追加の訓練コストなしに合成平行文を生成するプロンプトベースのデータ拡張を、ニューラル機械翻訳(NMT)に提案する。三つのプロンプト戦略—再表現、マルチターゲット翻訳、物語作成—を比較した結果、物語作成が最も多様なデータを生み出すことが示され、ベースライン比でBLEUスコアが0.68向上した。データ量を2倍にした際の最高性能は29.17 BLEUであった。

ABSTRACT

Despite the rapid growth in model architecture, the scarcity of large parallel corpora remains the main bottleneck in Neural Machine Translation. Data augmentation is a technique that enhances the performance of data-hungry models by generating synthetic data instead of collecting new ones. We explore prompt-based data augmentation approaches that leverage large-scale language models such as ChatGPT. To create a synthetic parallel corpus, we compare 3 methods using different prompts. We employ two assessment metrics to measure the diversity of the generated synthetic data. This approach requires no further model training cost, which is mandatory in other augmentation methods like back-translation. The proposed method improves the unaugmented baseline by 0.68 BLEU score.

研究の動機と目的

  • ニューラル機械翻訳(NMT)における大規模な平行コーパスの不足、特に低リソース言語やドメインに対して解決を図ること。
  • ChatGPTのような大規模な生成言語モデルを用いて、ファインチューニングを伴わずに合成平行データを生成するプロンプトベースのデータ拡張を検討すること。
  • 再表現、マルチターゲット翻訳、物語作成の異なるプロンプト設計が、データの多様性とモデル性能に与える影響を評価すること。
  • 元の文と合成文の間のコサイン類似度とBLEUスコアを用いて、生成された合成データの多様性を測定すること。
  • ドメインシフトやデータ不足が生じる状況において、データの多様性がNMT性能向上に不可欠であることを実証すること。

提案手法

  • 合成平行データを生成するために三つのプロンプトベースの手法を用いた:元のソース文とターゲット文の再表現、各ソース文に対して複数の翻訳を生成(マルチターゲット)、ソース言語で三文の物語を生成してから翻訳(物語作成)。
  • GPT-3.5-turboモデルは、OpenAIのAPIを介して、各手法に特化したテンプレートを用いてプロンプト化され、意味を保ちつつ変異を増やすように設計されたプロンプトが使用された。
  • 文の埋め込みはLASERエンコーダーを用いて計算され、元の文と合成文のペア間のコサイン類似度が多様性の指標として用いられた。
  • 語彙的類似度は、元のターゲット文と合成ターゲット文の間のBLEUスコアで測定され、語彙的乖離度が評価された。
  • mBART-50モデルは、元のデータおよび拡張済みデータでファインチューニングされ、ホールドアウトされたテストセットを用いてSacreeBLEUで評価された。
  • 実験では、データ拡張比を0.5倍から3.0倍まで変化させ、バリデーションBLEUスコアに基づいて最良のチェックポイントが選択された。

実験結果

リサーチクエスチョン

  • RQ1生成言語モデルを用いたプロンプトベースのデータ拡張は、追加の訓練コストなしにNMT性能を向上させるか?
  • RQ2再表現、マルチターゲット翻訳、物語作成といった異なるプロンプト戦略は、合成平行データの多様性と品質にどのように影響するか?
  • RQ3埋め込み類似度とBLEUスコアで測定されるデータ多様性は、NMTモデル性能の向上とどの程度相関するか?
  • RQ4物語作成ベースの拡張は、ドメイン外の誤解(ホールリネーション)を軽減し、低リソース環境での耐性を高められるか?
  • RQ5どのプロンプト設計が、拡張なしのベースライン比で最高のBLEUスコア向上を達成するか?

主な発見

  • 物語作成法は、合成データを元のデータ量の2.0倍に拡張した際、29.17の最高BLEUスコアを達成し、28.49のベースラインを上回った。
  • 再表現法とマルチターゲット法は、拡張率が上昇するにつれてBLEUスコアが低下し、データ多様性が限定的で過学習の可能性があることが示された。
  • 物語作成法は、元の文と合成文の間で最小のコサイン類似度(0.596)とBLEUスコア(2.908)を示し、より高いデータ多様性を確認した。
  • 再表現法は、最大のコサイン類似度(0.900)とBLEUスコア(23.409)を示し、元の文からの変化が最小であることを示した。
  • マルチターゲット法は中程度の多様性を示し、コサイン類似度が0.825、BLEUが15.543であったが、依然として物語作成法に性能で劣った。
  • 本研究は、NMTにおける訓練データ分布と現実世界の言語分布のギャップを埋めるために、多様な合成データを生成することが不可欠であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。