[论文解读] Language Models are Good Translators
本文提出 Lm4Mt,一种单一语言模型,通过使用统一表示联合建模源语句和目标语句,实现了具有竞争力的机器翻译性能。通过在源端引入衰减的自编码损失,Lm4Mt 在零样本翻译和基于中间语的翻译中均优于标准编码器-解码器神经机器翻译模型,展现出更优的跨语言知识迁移能力和鲁棒性。
Recent years have witnessed the rapid advance in neural machine translation (NMT), the core of which lies in the encoder-decoder architecture. Inspired by the recent progress of large-scale pre-trained language models on machine translation in a limited scenario, we firstly demonstrate that a single language model (LM4MT) can achieve comparable performance with strong encoder-decoder NMT models on standard machine translation benchmarks, using the same training data and similar amount of model parameters. LM4MT can also easily utilize source-side texts as additional supervision. Though modeling the source- and target-language texts with the same mechanism, LM4MT can provide unified representations for both source and target sentences, which can better transfer knowledge across languages. Extensive experiments on pivot-based and zero-shot translation tasks show that LM4MT can outperform the encoder-decoder NMT model by a large margin.
研究动机与目标
- 探究单一语言模型是否能够与标准编码器-解码器神经机器翻译(NMT)模型在性能上持平或超越。
- 探讨源端自编码监督对跨语言表征学习和翻译质量的影响。
- 评估统一句子表征在提升零样本翻译和基于中间语翻译中的有效性。
- 确定无需独立编码器和解码器组件的简化架构是否能在模型规模相当的情况下保持强大性能。
提出的方法
- Lm4Mt 使用单一自回归语言模型,采用相同的架构和参数生成源语句和目标语句。
- 它引入一种衰减的自编码损失 $\mathcal{L}^{\mathrm{\textsc{AE}}}$,用于重建源语言句子,从而提升对输入文本的理解。
- 模型通过联合目标进行训练:$\mathcal{L}^{\mathrm{\textsc{MT}}}$ 用于翻译,$\mathcal{L}^{\mathrm{\textsc{AE}}}$ 用于源端重建。
- 训练策略对自编码损失应用衰减权重,逐步降低其在训练过程中的影响。
- 统一的表征空间促进了更好的跨语言知识迁移,尤其在未见翻译方向上表现更优。
- 模型性能在 WMT14 英语-德语和英语-法语等标准基准上进行评估,并对损失组件进行了消融研究。
实验结果
研究问题
- RQ1单一语言模型是否能在模型规模相近的情况下,实现与标准编码器-解码器 NMT 模型相当或更优的翻译性能?
- RQ2源端自编码监督如何提升翻译质量与鲁棒性?
- RQ3跨语言的统一表征是否能增强零样本翻译和基于中间语翻译的性能?
- RQ4自编码损失对多语言翻译中零样本泛化的贡献有多大?
主要发现
- 在 WMT14 英语-德语翻译任务中,Lm4Mt-Base 达到 29.3 BLEU,优于 Transformer-Base 模型(24.4 BLEU)在零样本翻译中的表现。
- 在英语-法语翻译任务中,Lm4Mt-Base 达到 42.9 BLEU,与标准基准上的强基线模型持平或超越。
- 在零样本翻译中,Lm4Mt-Big 在德语→法语方向达到 29.5 BLEU,相较 Transformer-Big 的 26.1,展现出显著提升。
- 引入自编码损失 $\mathcal{L}^{\mathrm{\textsc{AE}}}$ 在部分方向上使零样本性能提升超过 10 BLEU 点,例如在英语→德语方向中,从 7.9 提升至 24.9。
- Lm4Mt 减少了非目标语言的翻译错误,零样本英语→法语任务中,18.6% 的输出能正确识别目标语言,而基线模型仅为 8.6%。
- 即使两模型均生成了正确语言的输出,Lm4Mt 的 BLEU 分数仍更高(英语→德语方向为 24.9 vs. 25.9),表明其翻译质量更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。