Skip to main content
QUICK REVIEW

[论文解读] Sequence to Sequence Mixture Model for Diverse Machine Translation

Xuanli He, Gholamreza Haffari|arXiv (Cornell University)|Oct 17, 2018
Natural Language Processing Techniques参考文献 21被引用 13
一句话总结

本文提出 S2SMix,一种序列到序列混合模型,通过使用一组专业化的神经机器翻译模型,提升翻译的多样性与质量。每个组件通过边缘对数似然优化学习平行语料库的软聚类,从而在参数增加可忽略不计且推理时无计算成本的情况下,实现多样化、高质量的翻译。

ABSTRACT

Sequence to sequence (SEQ2SEQ) models often lack diversity in their generated translations. This can be attributed to the limitation of SEQ2SEQ models in capturing lexical and syntactic variations in a parallel corpus resulting from different styles, genres, topics, or ambiguity of the translation process. In this paper, we develop a novel sequence to sequence mixture (S2SMIX) model that improves both translation diversity and quality by adopting a committee of specialized translation models rather than a single translation model. Each mixture component selects its own training dataset via optimization of the marginal loglikelihood, which leads to a soft clustering of the parallel corpus. Experiments on four language pairs demonstrate the superiority of our mixture model compared to a SEQ2SEQ baseline with standard or diversity-boosted beam search. Our mixture model uses negligible additional parameters and incurs no extra computation cost during decoding.

研究动机与目标

  • 解决标准序列到序列(Seq2Seq)神经机器翻译模型中缺乏多样性的缺陷。
  • 在提升翻译质量的同时,增加生成输出中的词汇和句法多样性。
  • 开发一种模型,与标准 Seq2Seq 相比,保持较低的推理成本和极少的参数开销。
  • 在无需显式标注或额外监督的情况下,学习平行语料库中的领域或风格特异性变化。
  • 通过建模潜在变化的混合专业组件,实现多样化且高质量的翻译。

提出的方法

  • 引入一种序列到序列混合模型(S2SMix),为每个输入句子引入一个全局离散隐变量,以基于训练数据中的不同聚类进行条件控制。
  • 每个混合组件通过优化边缘对数似然进行训练,从而根据语言差异诱导平行语料库的软聚类。
  • 混合组件共享大部分模型参数和计算,最大限度减少额外参数和推理成本。
  • 在训练期间使用蒙特卡洛采样近似后验分布,以应对大规模混合模型带来的高昂内存成本。
  • 在四种语言对(En→De、En→Fr、En→Vi、En→Es)上应用该模型,采用基于注意力机制的 Seq2Seq 模型,编码器为双向 LSTMs,解码器为两层结构。
  • 解码过程采用标准的束搜索算法,未对解码算法进行任何修改。

实验结果

研究问题

  • RQ1混合专业化的 Seq2Seq 模型是否能在不牺牲质量的前提下提升翻译多样性?
  • RQ2通过边缘对数似然学习实现的平行语料库软聚类,是否能有效捕捉语言差异(如风格、体裁、主题)?
  • RQ3与标准 Seq2Seq 模型或采用多样性增强束搜索的模型相比,S2SMix 模型是否在多样性与 BLEU 分数上表现更优?
  • RQ4该模型是否能在提升性能的同时,保持低推理成本和极少的参数增加?
  • RQ5该模型在多种语言对和翻译领域中是否均有效?

主要发现

  • 在四种语言对上,S2SMix 在 BLEU 分数和翻译多样性方面均持续优于标准 Seq2Seq 模型及采用多样性增强束搜索的基线模型。
  • 该模型能为同一输入生成多个正确且多样的翻译,包括同义词和句法变化,如定性示例所示。
  • 当使用四个混合组件时,S2SMix 在多样性与 BLEU 分数上均取得显著提升,表明即使组件数量较少,该方法也具有效果。
  • 该模型引入的额外参数可忽略不计,且推理阶段无额外计算成本,因此高效且易于部署。
  • 通过边缘对数似然优化诱导的软聚类,能成功将具有相似语言差异的句子分组,从而支持专业组件的学习。
  • 使用多样性度量的定量分析表明,S2SMix 生成的输出比基线模型更具多样性,同时保持或提升了流畅性与准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。