[论文解读] Hint-Based Training for Non-Autoregressive Machine Translation
本文提出了一种基于提示的非自回归神经机器翻译(NART)训练方法,通过利用预训练自回归教师模型的隐藏状态相似性和注意力分布,提升翻译质量。该方法显著提升了NART性能——在推理速度相比自回归基线模型提升30.2倍的同时,达到与强基准LSTM自回归模型相当的BLEU分数,且未引入计算成本高昂的组件。
Due to the unparallelizable nature of the autoregressive factorization, AutoRegressive Translation (ART) models have to generate tokens sequentially during decoding and thus suffer from high inference latency. Non-AutoRegressive Translation (NART) models were proposed to reduce the inference time, but could only achieve inferior translation accuracy. In this paper, we proposed a novel approach to leveraging the hints from hidden states and word alignments to help the training of NART models. The results achieve significant improvement over previous NART models for the WMT14 En-De and De-En datasets and are even comparable to a strong LSTM-based ART baseline but one order of magnitude faster in inference.
研究动机与目标
- 为解决非自回归翻译(NART)模型因缺乏自回归依赖关系而导致的输出不一致问题。
- 在不牺牲推理速度的前提下,通过避免复杂的架构修改来提升NART性能。
- 探究自回归模型的隐藏状态相关性和注意力分布是否可作为NART训练的有效监督信号。
- 在保持数量级更快的推理速度的同时,使NART性能达到与强自回归基线模型相当的水平。
提出的方法
- 该方法使用一个预训练的自回归模型(ART)作为教师,提取隐藏状态表征和注意力分布以提供监督。
- 引入两类提示:(1) 隐藏状态相似性正则化,以减少冗余和重复输出;(2) 基于对齐的注意力蒸馏,以提升注意力分布质量。
- NART模型采用多任务损失进行训练,结合负对数似然(NLL)、对齐损失和隐藏状态相似性损失。
- 隐藏状态相似性损失通过最小化不同位置解码器隐藏状态之间的余弦相似度,以抑制重复预测。
- 对齐损失促使NART模型的编码器-解码器注意力匹配自回归教师模型的注意力模式。
- 该方法应用于基于Transformer的NART模型,输入为源句的副本,且在自注意力层中不使用自回归掩码。
实验结果
研究问题
- RQ1自回归模型的隐藏状态表征能否改善非自回归翻译模型的训练?
- RQ2从自回归模型蒸馏注意力分布是否能减少歧义并改善NART输出的对齐性?
- RQ3提示训练能否在不增加计算开销的前提下弥合NART与自回归模型之间的性能差距?
- RQ4隐藏状态相似性和注意力蒸馏在多大程度上减少了NART模型中重复或不连贯短语的生成?
主要发现
- 所提出的基于提示的NART模型在WMT14 De-En上达到25.55的BLEU分数,优于最佳先前NART模型(LT带重排序)3.0 BLEU点。
- 在WMT14 En-De上,模型达到21.11 BLEU,超过先前SOTA NART模型(LT带重排序)1.9 BLEU点。
- 与自回归Transformer基线相比,模型在推理速度上实现30.2倍的加速,每句延迟仅为26ms。
- 在IWSLT14 De-En上,翻译中重复词的比例从8.3%降至6.5%,表明输出一致性得到改善。
- 消融实验表明,对齐提示贡献了1.6 BLEU点,隐藏状态提示贡献了0.8 BLEU点的性能提升。
- 在长句(长度≥40)上,模型相比基线BLEU提升3.15点(20.63 vs. 17.48),表现出强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。