Skip to main content
QUICK REVIEW

[论文解读] Parallel Machine Translation with Disentangled Context Transformer

Jungo Kasai, James Cross|arXiv (Cornell University)|Jan 15, 2020
Natural Language Processing Techniques被引用 23
一句话总结

本文提出了一种去耦上下文(Disentangled Context, DisCo)Transformer模型,这是一种非自回归神经机器翻译模型,通过使用注意力掩码实现上下文解耦,使每个输出标记都能基于参考标记的任意子集进行并行生成。该模型在7种翻译方向上均实现了最先进的翻译质量,同时显著降低了推理时间。

ABSTRACT

State-of-the-art neural machine translation models generate a translation from left to right and every step is conditioned on the previously generated tokens. The sequential nature of this generation process causes fundamental latency in inference since we cannot generate multiple tokens in each sentence in parallel. We propose an attention-masking based model, called Disentangled Context (DisCo) transformer, that simultaneously generates all tokens given different contexts. The DisCo transformer is trained to predict every output token given an arbitrary subset of the other reference tokens. We also develop the parallel easy-first inference algorithm, which iteratively refines every token in parallel and reduces the number of required iterations. Our extensive experiments on 7 translation directions with varying data sizes demonstrate that our model achieves competitive, if not better, performance compared to the state of the art in non-autoregressive machine translation while significantly reducing decoding time on average. Our code is available at this https URL.

研究动机与目标

  • 解决自回归神经机器翻译中因从左到右生成标记而导致的延迟瓶颈问题。
  • 在不牺牲翻译质量的前提下,实现所有输出标记的并行生成。
  • 设计一种训练范式,使每个输出标记基于参考序列的不同子集进行条件预测,以提升模型的鲁棒性与泛化能力。
  • 设计一种高效的推理算法,通过迭代并行优化所有标记来加速收敛。
  • 在多种翻译方向和不同数据规模下展示优异性能,其在准确率与速度方面均优于或匹配当前最先进非自回归模型。

提出的方法

  • 提出一种注意力掩码机制,使每个输出标记能够关注其他参考标记的任意子集,从而实现去耦上下文建模。
  • 训练模型在给定参考序列任意子集的条件下预测每个输出标记,以增强对部分上下文的鲁棒性。
  • 设计并行优先推理算法(parallel easy-first inference algorithm),通过迭代并行优化所有标记,减少所需的解码迭代次数。
  • 采用标准Transformer架构,并通过修改交叉注意力机制以支持去耦上下文设置。
  • 在训练中采用课程学习策略,逐步增加监督所用上下文子集的复杂度。
  • 采用标准序列到序列训练目标与标准分词和归一化方法,同时聚焦于注意力掩码与训练目标的设计。

实验结果

研究问题

  • RQ1非自回归Transformer模型是否能在实现输出标记完全并行生成的同时,达到具有竞争力的翻译质量?
  • RQ2将每个输出标记基于参考标记的任意子集进行条件预测,如何提升模型的鲁棒性与性能?
  • RQ3与标准非自回归或自回归方法相比,所提出的并行优先推理算法在多大程度上减少了解码时间?
  • RQ4与现有非自回归基线相比,该模型在多种翻译方向和不同数据规模下的表现如何?
  • RQ5去耦上下文机制是否能带来更好的泛化能力与更快的推理收敛速度?

主要发现

  • DisCo Transformer在7种翻译方向上均实现了与最先进非自回归模型相当或更优的翻译性能。
  • 该模型显著降低了平均解码时间,证明了并行优先推理策略的有效性。
  • 基于注意力掩码的训练方案使模型能够利用多样化的上下文子集稳健预测每个输出标记,从而提升泛化能力。
  • 即使在训练数据有限的情况下,模型仍保持强劲性能,表明去耦上下文设计具有强大的归纳偏置。
  • 并行推理算法通过高效并行优化所有标记,显著减少了所需的迭代次数。
  • 该方法在多种语言对上均表现出良好的泛化能力,推理速度持续提升,且性能未出现显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。