Skip to main content
QUICK REVIEW

[论文解读] Bilingual-GAN: A Step Towards Parallel Text Generation

Ahmad Rashid, Alan Do-Omri|arXiv (Cornell University)|Apr 9, 2019
Topic Modeling参考文献 29被引用 6
一句话总结

Bilingual-GAN 提出了一种生成对抗网络,通过仅使用单语数据学习两种语言之间的共享潜在空间,实现并行、双向的句子生成。通过将去噪自编码器与潜在码的对抗训练相结合,即使在无监督设置下,也能生成流畅且语义对齐的翻译,其在流畅性和并行性方面优于基线模型。

ABSTRACT

Latent space based GAN methods and attention based sequence to sequence models have achieved impressive results in text generation and unsupervised machine translation respectively. Leveraging the two domains, we propose an adversarial latent space based model capable of generating parallel sentences in two languages concurrently and translating bidirectionally. The bilingual generation goal is achieved by sampling from the latent space that is shared between both languages. First two denoising autoencoders are trained, with shared encoders and back-translation to enforce a shared latent state between the two languages. The decoder is shared for the two translation directions. Next, a GAN is trained to generate synthetic "code" mimicking the languages' shared latent space. This code is then fed into the decoder to generate text in either language. We perform our experiments on Europarl and Multi30k datasets, on the English-French language pair, and document our performance using both supervised and unsupervised machine translation.

研究动机与目标

  • 将双语文本生成建模为联合问题,模拟多语者如何从共享的概念表征中生成任一语言的文本。
  • 解决在不依赖平行单语语料库的情况下生成语义对齐的并行句子的挑战。
  • 在序列到序列模型的潜在空间中引入对抗训练,以提升文本生成质量。
  • 探索仅使用单语数据集实现高质量并行文本生成的可行性。
  • 建立一个统一框架,同时支持无监督机器翻译和并行文本生成。

提出的方法

  • 在单语语料上训练两个具有共享编码器的去噪自编码器,利用回译机制在潜在空间中强制对齐。
  • 解码器在两种语言方向上共享,从而实现从共享潜在表征出发的双向翻译。
  • 训练一个 GAN 以生成模仿共享编码器真实潜在分布的合成潜在码。
  • 生成器生成的潜在码被解码为任一语言的流畅句子,通过共享语义确保并行性。
  • 模型利用多语言嵌入和 BPE 分词技术,以改善跨语言对齐和泛化能力。
  • 在 Europarl 和 Multi30k 数据集上进行训练,采用监督和无监督两种设置以评估不同设置下的性能。

实验结果

研究问题

  • RQ1能否从单语数据中有效学习共享潜在空间,以实现在两种语言中并行生成句子?
  • RQ2基于 GAN 的生成器在多大程度上能生成逼真的潜在码,从而产生流畅且语义对齐的翻译?
  • RQ3在没有并行训练数据的情况下,该模型在多大程度上能生成高质量的并行句子?
  • RQ4在监督和无监督训练设置下,生成句子的质量有何差异?
  • RQ5当仅使用单语数据进行预训练时,该模型是否仍能实现强并行性和流畅性?

主要发现

  • 在 Europarl 数据集上,Bilingual-GAN 在监督设置下达到 4.14(英语)和 3.80(法语)的流畅性得分,平行性得分为 3.05。
  • 在 Europarl 的无监督设置下,模型达到 3.88(英语)和 3.52(法语)的流畅性得分,平行性得分为 2.52。
  • 在 Multi30k 数据集上,监督模型的流畅性得分为 3.41(英语)和 3.20(法语),平行性得分为 2.39。
  • 无监督的 Multi30k 模型达到 4.07(英语)和 3.24(法语)的流畅性得分,平行性得分为 1.97,表明即使无并行数据,性能依然强劲。
  • 人工评估确认,生成的句子表现出有意义的并行性,尤其在监督设置下,真实句子的得分显著高于生成句子。
  • 表 5 中的定性示例显示,即使在无监督设置下,该模型仍能生成语义连贯且对齐的句子对,证明其能从单语数据中学习跨语言对齐能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。