Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Paraphrase Generation with Multilingual Language Models

Yinpeng Guo, Yi Liao|arXiv (Cornell University)|Nov 9, 2019
Topic Modeling参考文献 30被引用 15
一句话总结

该论文提出了一种基于多语言语言模型的单步、端到端零样本释义生成模型,直接在平行语料上进行训练,无需依赖来回翻译。通过采用基于Transformer的架构,结合GPT风格的预训练和去噪自编码,该模型在相关性、流畅性和多样性方面优于基于中间语言的转换方法,同时降低了推理成本和语义漂移。

ABSTRACT

Leveraging multilingual parallel texts to automatically generate paraphrases has drawn much attention as size of high-quality paraphrase corpus is limited. Round-trip translation, also known as the pivoting method, is a typical approach to this end. However, we notice that the pivoting process involves multiple machine translation models and is likely to incur semantic drift during the two-step translations. In this paper, inspired by the Transformer-based language models, we propose a simple and unified paraphrasing model, which is purely trained on multilingual parallel data and can conduct zero-shot paraphrase generation in one step. Compared with the pivoting approach, paraphrases generated by our model is more semantically similar to the input sentence. Moreover, since our model shares the same architecture as GPT (Radford et al., 2018), we are able to pre-train the model on large-scale unparallel corpus, which further improves the fluency of the output sentences. In addition, we introduce the mechanism of denoising auto-encoder (DAE) to improve diversity and robustness of the model. Experimental results show that our model surpasses the pivoting method in terms of relevance, diversity, fluency and efficiency.

研究动机与目标

  • 通过在无需并行释义数据的情况下实现零样本释义生成,解决高质量释义语料库的局限性。
  • 克服依赖多个翻译系统、存在固有语义漂移和低效性的来回翻译流水线的缺陷。
  • 通过大规模单语预训练和去噪自编码,提升生成释义的流畅性和多样性。
  • 开发一个统一的端到端模型,直接从多语言平行数据中学习释义分布。
  • 通过单语预训练的迁移学习,实现在低资源语言中的有效零样本释义生成。

提出的方法

  • 在连接的双语平行句子上训练基于Transformer的解码器语言模型,并引入语言特定标记,以实现跨语言理解与生成。
  • 在大规模单语语料上进行GPT风格的自回归预训练,以提升流畅性和泛化能力,尤其在低资源语言中表现更优。
  • 在预训练过程中引入去噪自编码器(DAE)机制,通过掩码和重建输入标记来增强模型的鲁棒性和多样性。
  • 在推理阶段,以源语言中的输入句子为条件,使用自回归解码在同种语言中生成释义。
  • 通过在平行语料中源句与目标句联合分布上的最大似然估计,对模型进行端到端优化。
  • 通过温度采样控制生成多样性,并利用BLEU和Distinct-2等自动指标平衡相关性与流畅性。

实验结果

研究问题

  • RQ1一个在多语言平行数据上端到端训练的统一模型,是否能在零样本释义生成中优于标准的来回翻译方法?
  • RQ2在单语数据上进行预训练,在多大程度上能提升低资源语言的流畅性和零样本性能?
  • RQ3去噪自编码机制的引入,如何影响生成释义的多样性和鲁棒性?
  • RQ4与两步中间语言转换方法相比,该方法是否能有效减少语义漂移?
  • RQ5该模型是否能在无需在特定语言释义数据上微调的情况下,有效泛化到多种语言?

主要发现

  • 在自动评估和人工评估中,该模型在相关性、流畅性、多样性和效率方面均显著优于来回翻译基线方法。
  • 人工评估显示,该模型生成的释义与输入句子的语义相似度更高,语义漂移更小。
  • 模型获得更高的Distinct-2分数和更低的逆Self-BLEU,表明其具有更好的词汇多样性和更低的重复率。
  • 使用GPT风格预训练显著提升了流畅性,尤其在低资源语言中,且无需额外微调。
  • 去噪自编码机制在不牺牲语义相关性的情况下,增强了模型的鲁棒性和多样性。
  • 推理速度更快、效率更高,因为它避免了两阶段解码和多个翻译系统的使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。