Skip to main content
QUICK REVIEW

[论文解读] Glancing Transformer for Non-Autoregressive Neural Machine Translation

Lihua Qian, Hao Zhou|arXiv (Cornell University)|Aug 18, 2020
Natural Language Processing Techniques参考文献 32被引用 20
一句话总结

本文提出 Glancing Transformer (GLAT),一种非自回归神经机器翻译模型,通过自适应、单次遍历的并行解码方式,利用渐进语言模型(GLM)学习词之间的依赖关系。通过在训练过程中动态采样参考词,并使用编码器表示代替 [MASK] 标记,GLAT 在多个 WMT 基准测试中实现了比自回归 Transformer 快 8×–15× 的推理速度,同时将 BLEU 分数差距缩小至仅 0.25–0.9 分。

ABSTRACT

Recent work on non-autoregressive neural machine translation (NAT) aims at improving the efficiency by parallel decoding without sacrificing the quality. However, existing NAT methods are either inferior to Transformer or require multiple decoding passes, leading to reduced speedup. We propose the Glancing Language Model (GLM), a method to learn word interdependency for single-pass parallel generation models. With GLM, we develop Glancing Transformer (GLAT) for machine translation. With only single-pass parallel decoding, GLAT is able to generate high-quality translation with 8-15 times speedup. Experiments on multiple WMT language directions show that GLAT outperforms all previous single pass non-autoregressive methods, and is nearly comparable to Transformer, reducing the gap to 0.25-0.9 BLEU points.

研究动机与目标

  • 在不牺牲推理速度的前提下,弥合非自回归与自回归神经机器翻译之间的性能差距。
  • 在非自回归模型中实现单次遍历的并行解码,同时捕捉通常通过自回归生成学习到的词间依赖关系。
  • 开发一种训练策略,逐步从学习句子片段过渡到完整序列,模拟课程学习过程。
  • 用更自然的编码器表示替代迭代方法中的 [MASK] 标记机制,以提升生成质量。

提出的方法

  • 引入渐进语言模型(GLM),在训练过程中执行两次解码:第一次为标准 NAT 解码,用于评估难度;第二次为渐进解码,从参考文本中采样难以预测的词。
  • 采用自适应渐进采样策略,优先采样预测置信度较低的词,实现从片段到完整序列的渐进式学习。
  • 将掩码语言建模中的 [MASK] 标记替换为对应位置的直接编码器表示,以增强上下文感知能力。
  • 仅使用第二次解码过程进行模型训练,其中对未采样词的预测结果进行优化,确保端到端的完整序列生成学习。
  • 采用随机词选择策略进行渐进采样,实证表明其因增强了对词间依赖关系的探索,性能优于基于置信度的策略。
  • 通过逐步减少渐进采样比例来应用课程学习原则,随着模型置信度提升,实现稳定且高效的单次遍历推理。

实验结果

研究问题

  • RQ1单次遍历的非自回归模型是否能在无需迭代优化的情况下,实现与自回归 Transformer 接近的性能?
  • RQ2在训练过程中采用自适应渐进采样是否能提升并行生成中的词间依赖建模能力?
  • RQ3用编码器表示替代 [MASK] 标记是否能提升非自回归模型中的生成质量?
  • RQ4采样策略选择(随机 vs. 基于置信度)对最终翻译质量有何影响?
  • RQ5GLAT 在保持高推理速度的同时,能在多大程度上缩小与自回归模型之间的 BLEU 分数差距?

主要发现

  • GLAT 在多个 WMT 语言方向上实现了比自回归 Transformer 快 8×–15× 的推理速度,同时将 BLEU 分数差距缩小至仅 0.25–0.9 分。
  • 在 WMT14 DE-EN 数据集上,当参考句长小于 20 个词时,GLAT 的表现优于强基线的 Mask-Predict 迭代方法。
  • 随机渐进采样策略表现最佳,相比基线 NAT 模型提升 5.0 BLEU 分,相比基于置信度的策略提升 0.3–0.6 BLEU 分。
  • 即使在采用渐进采样后,用编码器表示替代 [MASK] 标记仍能带来 0.2–0.3 BLEU 分的性能提升。
  • 消融实验证实,自适应渐进采样是性能提升的主要来源,而编码器表示则提供了次要但显著的增益。
  • GLAT 在 WMT14 EN-DE 上达到 25.21 BLEU,在 WMT14 DE-EN 上达到 29.84 BLEU,优于所有先前的单次遍历非自回归方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。