Skip to main content
QUICK REVIEW

[论文解读] End-to-End Non-Autoregressive Neural Machine Translation with Connectionist Temporal Classification

Jindřich Libovický, Jindřich Helcl|arXiv (Cornell University)|Nov 12, 2018
Natural Language Processing Techniques参考文献 14被引用 6
一句话总结

该论文提出了一种端到端的非自回归神经机器翻译模型,采用连接时序分类(CTC)实现无需迭代优化的并行解码。通过将编码器状态投影为更长的序列并应用CTC损失,该模型在英语-罗马尼亚语和英语-德语任务上实现了比自回归基线模型快4倍的推理速度,同时保持了自回归模型80–90%的翻译质量(BLEU分数)。

ABSTRACT

Autoregressive decoding is the only part of sequence-to-sequence models that prevents them from massive parallelization at inference time. Non-autoregressive models enable the decoder to generate all output symbols independently in parallel. We present a novel non-autoregressive architecture based on connectionist temporal classification and evaluate it on the task of neural machine translation. Unlike other non-autoregressive methods which operate in several steps, our model can be trained end-to-end. We conduct experiments on the WMT English-Romanian and English-German datasets. Our models achieve a significant speedup over the autoregressive models, keeping the translation quality comparable to other non-autoregressive models.

研究动机与目标

  • 为解决自回归神经机器翻译中的序列瓶颈问题,实现在推理阶段的完全并行化。
  • 开发一种可端到端训练的非自回归NMT模型,无需单独阶段或迭代优化。
  • 在显著提升推理速度的同时,保持与自回归模型相当的翻译质量。
  • 探索将连接时序分类(CTC)作为无需对齐监督的序列到序列翻译统一训练目标的可行性。

提出的方法

  • 模型使用Transformer编码器,并通过可学习投影将每个编码器状态扩展为k个向量,生成长度为k×Tx的序列s。
  • CTC风格的解码器并行处理序列s,无需自回归约束,可同时生成输出词元或空符号。
  • CTC损失通过前向-后向算法对所有有效对齐路径求和,计算输出序列与参考序列之间所有可能对齐的概率。
  • 模型通过CTC目标端到端训练,无需单独的长度估计或迭代优化步骤。
  • 该架构避免在自注意力中使用掩码,从而在推理阶段实现完全并行化。

实验结果

研究问题

  • RQ1能否在无需单独长度估计或迭代优化的情况下,使用CTC实现端到端训练的非自回归NMT模型?
  • RQ2基于CTC的端到端非自回归模型的翻译质量与自回归模型及多阶段非自回归基线相比如何?
  • RQ3分裂因子k在多大程度上影响模型性能与推理效率?
  • RQ4在基于CTC的模型中,空符号数量与翻译质量之间是否存在相关性?

主要发现

  • 与自回归基线相比,该模型在推理时间上实现了4倍加速,英语-德语翻译任务的平均推理时间仅为350ms(GPU上)。
  • 在WMT英语-德语翻译任务中,该模型在en-de方向达到25.12 BLEU,在de-en方向达到28.89 BLEU,相当于自回归基线性能的80–90%。
  • 模型性能与空符号数量呈轻微正相关(r = 0.15),表明增加分裂因子k可能提升性能,但会带来更高的显存消耗。
  • 在非自回归模型中,句子级别BLEU分数随源句长度增加而下降的程度略高于自回归模型(r = -0.42 vs r = -0.39),表明存在适度的长度泛化差距。
  • 人工评估显示,非自回归模型正确翻译的比例较低(23% vs 65%),错误类型包括缺少动词或命名实体损坏等,但其BLEU分数仍优于部分先前的非自回归方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。