Skip to main content
QUICK REVIEW

[論文レビュー] Bilingual-GAN: A Step Towards Parallel Text Generation

Ahmad Rashid, Alan Do-Omri|arXiv (Cornell University)|Apr 9, 2019
Topic Modeling参考文献 29被引用数 6
ひとこと要約

Bilingual-GANは、二か国語間の共有潜在空間を学習する生成的対抗ネットワークを提案し、モノリンガルデータのみを用いて並列文を同時に双方向に生成することを可能にする。潜在変数における敵対的訓練とノイズ除去オートエンコーダーを組み合わせることで、教師なし設定下でも滑らかで意味的に整合した翻訳を達成し、ベースラインを上回るスコアを記録する。

ABSTRACT

Latent space based GAN methods and attention based sequence to sequence models have achieved impressive results in text generation and unsupervised machine translation respectively. Leveraging the two domains, we propose an adversarial latent space based model capable of generating parallel sentences in two languages concurrently and translating bidirectionally. The bilingual generation goal is achieved by sampling from the latent space that is shared between both languages. First two denoising autoencoders are trained, with shared encoders and back-translation to enforce a shared latent state between the two languages. The decoder is shared for the two translation directions. Next, a GAN is trained to generate synthetic "code" mimicking the languages' shared latent space. This code is then fed into the decoder to generate text in either language. We perform our experiments on Europarl and Multi30k datasets, on the English-French language pair, and document our performance using both supervised and unsupervised machine translation.

研究の動機と目的

  • 多言語を話す人々が共通の概念的表現からどちらの言語でも生成するのを模倣するために、二か国語のテキスト生成を統合的な問題としてモデル化すること。
  • 並列モノリンガルコーパスに依存せずに意味的に整合した並列文を生成する課題に取り組むこと。
  • 系列対系列モデルの潜在空間における敵対的訓練を統合し、テキスト生成品質を向上させること。
  • モノリンガルデータセットのみを用いて高品質な並列テキスト生成が可能かどうかを検討すること。
  • 教師あり機械翻訳と並列テキスト生成の両方をサポートする統一フレームワークを確立すること。

提案手法

  • モノリンガルコーパス上で学習される、共有エンコーダーを備えた二つのノイズ除去オートエンコーダーを、潜在空間における整合性を強制するためにバックトランスレーションを用いて訓練する。
  • デコーダーは両言語方向で共有されており、共有潜在表現から双方向翻訳を可能にする。
  • 実際の共有エンコーダーの潜在分布を模倣する合成潜在コードを生成するため、GANを訓練する。
  • 生成器は、両言語のどちらの言語でも滑らかな文に変換される潜在コードを生成し、共有された意味的整合性によって並列性を保証する。
  • 多言語埋め込みとBPEトークン化を活用して、クロスリンガル整合性と一般化性能を向上させる。
  • 性能評価のため、EuroparlおよびMulti30kデータセットを用い、教師ありおよび教師なしの両設定で訓練を実施する。

実験結果

リサーチクエスチョン

  • RQ1モノリンガルデータから効果的に共有潜在空間を学習できるか。これにより、二か国語の並列文を同時に生成できるか。
  • RQ2敵対的生成器が、現実的で滑らかで意味的に整合した翻訳をもたらす潜在コードをどれほどうまく生成できるか。
  • RQ3並列学習データにアクセスできない状況下で、モデルがどれほど高品質な並列文を生成できるか。
  • RQ4教師ありと教師なしの訓練設定下で、生成文の品質はどのように比較されるか。
  • RQ5モノリンガルデータでの事前学習のみで、強力な並列性と滑らかさを達成できるか。

主な発見

  • Europarlデータセットでは、教師あり設定下で、英語のスコアが4.14、フランス語のスコアが3.80の滑らかさを達成し、並列性スコアは3.05であった。
  • Europarlの教師なし設定下では、英語のスコアが3.88、フランス語のスコアが3.52の滑らかさを達成し、並列性スコアは2.52であった。
  • Multi30kデータセットでは、教師ありモデルが英語で3.41、フランス語で3.20の滑らかさスコアを記録し、並列性スコアは2.39であった。
  • 教師なしのMulti30kモデルは、英語で4.07、フランス語で3.24の滑らかさスコアを達成し、並列性スコアは1.97であった。これは、並列データなしでも優れた性能を示している。
  • 人的評価により、生成された文が意味的に整合した並列性を示していることが確認された。特に教師あり設定下では、実際の文よりも顕著に高いスコアが得られた。
  • 表5の定性的な例では、教師なし設定下でも、意味的に整合性があり並列な文のペアが生成されていることが示され、モノリンガルデータからのクロスリンガル整合性の学習能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。