Skip to main content
QUICK REVIEW

[論文レビュー] Improving Neural Machine Translation with Conditional Sequence Generative Adversarial Nets

Zhen Yang, Wei Chen|arXiv (Cornell University)|Mar 15, 2017
Natural Language Processing Techniques参考文献 31被引用数 11
ひとこと要約

本稿では、生成的敵対ネットワークを用いて人間の翻訳に類似した翻訳を共同で学習する条件付き系列GAN、BR-CSGANを提案する。敵対的学習と滑らか化された文単位BLEU目的関数を組み合わせることで、英独および中国語英語翻訳タスクにおいて、RNNSearchおよびTransformerベースラインを上回る最先端の性能を達成した。

ABSTRACT

This paper proposes an approach for applying GANs to NMT. We build a conditional sequence generative adversarial net which comprises of two adversarial sub models, a generator and a discriminator. The generator aims to generate sentences which are hard to be discriminated from human-translated sentences (i.e., the golden target sentences), And the discriminator makes efforts to discriminate the machine-generated sentences from human-translated ones. The two sub models play a mini-max game and achieve the win-win situation when they reach a Nash Equilibrium. Additionally, the static sentence-level BLEU is utilized as the reinforced objective for the generator, which biases the generation towards high BLEU points. During training, both the dynamic discriminator and the static BLEU objective are employed to evaluate the generated sentences and feedback the evaluations to guide the learning of the generator. Experimental results show that the proposed model consistently outperforms the traditional RNNSearch and the newly emerged state-of-the-art Transformer on English-German and Chinese-English translation tasks.

研究の動機と目的

  • 最大尤度推定の限界を解消すること。これは、局所的な語単位の尤度最適化に焦点を当てるが、文単位の出力が最適でない可能性があるためである。
  • 敵対的学習を用いて、生成器が人間の翻訳と区別がつかない文を生成できるようにすることで、翻訳品質を向上させること。
  • 滑らか化された文単位BLEUという静的でタスク固有の目的関数を敵対的フレームワークに組み込み、生成器が高いBLEUスコアを目指すように導くこと。
  • 生成器と判別器の間でバランスの取れた学習ダイナミクスを実現するため、モード崩壊や劣悪な勾配信号を避けるために、判別器の初期精度を慎重に設定すること。
  • RNNSearchおよびTransformerを含む多様なNMTアーキテクチャに対して、提案手法の有効性を評価すること。

提案手法

  • モデルは、入力文に条件付けられた生成器と、翻訳文が人間によって作成されたものか機械生成されたものかを分類する判別器を備えた条件付き系列GANを採用する。
  • 生成器と判別器はミニマックスゲームとして訓練され、生成器がリアルな翻訳を生成し、判別器が本物と生成物を正確に識別できるナッシュ均衡に到達することを目的とする。
  • 滑らか化された文単位BLEUスコアを静的報酬目的関数として用い、高精度・高カバレッジの翻訳を生成するように生成器をガイドする。
  • 学習中に、動的判別器フィードバックと静的BLEU目的関数の両方を用いて報酬を計算し、ポリシー勾配法により生成器を更新する。
  • 訓練中の期待報酬を近似するために、異なるサンプルサイズ(N)を用いたモンテカルロ探索を用い、精度と計算コストのバランスを取る。
  • 判別器を初期精度約0.8に事前学習することで、敵対的学習の開始段階をバランスよく保ち、不安定性を回避する。

実験結果

リサーチクエスチョン

  • RQ1神経機械翻訳における敵対的学習を効果的に適用することで、文単位のなめらかさや自然さを向上させることができるか?
  • RQ2敵対的学習と文単位BLEU目的関数を組み合わせることで、標準的なMLEやMRTと比較して翻訳品質にどのような影響を与えるか?
  • RQ3初期判別器の精度が、敵対的学習プロセスの安定性と性能に与える影響は何か?
  • RQ4報酬近似におけるモンテカルロサンプル数(N)が、最終的な翻訳性能および学習安定性に与える影響は何か?
  • RQ5提案されたBR-CSGANフレームワークは、RNNSearchやTransformerといった異なるNMTアーキテクチャにおいて一貫して性能向上をもたらすか?

主な発見

  • BR-CSGANモデルは、英独および中国語英語翻訳タスクにおいて、RNNSearchおよびTransformerの両方を一貫して上回り、汎用性を示した。
  • 中国語英語翻訳タスクでは、N=20のモンテカルロサンプルを用いたモデルがNIST02でBLEUスコア38.74を達成し、事前学習済み生成器(36.87)を上回り、安定した改善を示した。
  • 判別器の初期精度が高すぎ(0.95)または低すぎ(0.6)の場合、モデル性能が著しく低下したため、初期段階でのバランスが学習安定性に極めて重要であることが示された。
  • モンテカルロサンプルサイズNが15未満に設定された場合、学習が不安定になり、BLEUスコアも悪化した。これは、サンプル数が不足することで報酬推定の分散が高くなるためである。
  • N ≥ 20では、サンプルサイズのさらなる増加が性能向上にほとんど寄与しなかったため、計算コストと報酬精度のトレードオフが明確に示された。
  • モデルはベースラインのRNNSearchおよびTransformerモデルを上回り、敵対的学習と滑らか化BLEU目的関数の組み合わせが、優れた翻訳品質をもたらすことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。