Skip to main content
QUICK REVIEW

[论文解读] ReWE: Regressing Word Embeddings for Regularization of Neural Machine Translation Systems

Iñigo Jauregi Unanue, Ehsan Zare Borzeshi|arXiv (Cornell University)|Apr 4, 2019
Natural Language Processing Techniques参考文献 32被引用 7
一句话总结

该论文提出 ReWE,一种用于神经机器翻译(NMT)的新型正则化技术,通过联合训练模型以预测下一个词(分类)和回归其词嵌入(连续),实现性能提升。在训练过程中引入预训练词嵌入作为回归目标,ReWE 改进了泛化能力,尤其在低资源设置下表现优异,相较于强基线模型和当前最先进模型,BLEU 分数稳定提升 0.91–2.54 分。

ABSTRACT

Regularization of neural machine translation is still a significant problem, especially in low-resource settings. To mollify this problem, we propose regressing word embeddings (ReWE) as a new regularization technique in a system that is jointly trained to predict the next word in the translation (categorical value) and its word embedding (continuous value). Such a joint training allows the proposed system to learn the distributional properties represented by the word embeddings, empirically improving the generalization to unseen sentences. Experiments over three translation datasets have showed a consistent improvement over a strong baseline, ranging between 0.91 and 2.54 BLEU points, and also a marked improvement over a state-of-the-art system.

研究动机与目标

  • 为解决神经机器翻译(NMT)在低资源设置下的泛化能力限制,特别是由于暴露偏差以及对语义相似词语处理不佳的问题。
  • 通过在训练过程中利用预训练词嵌入中编码的分布特性,提升模型鲁棒性。
  • 开发一种正则化方法,增强泛化能力,同时不改变推理过程,保持与标准 NMT 流水线的兼容性。
  • 探究联合预测词语类别与连续词嵌入是否能比标准最大似然估计带来更好的泛化效果。

提出的方法

  • 模型将标准 seq2seq 解码器修改为输出两个结果:通过 softmax 进行下一个词的分类预测,以及通过两层网络进行词嵌入的连续向量预测。
  • 连续预测通过均方误差(MSE)或余弦嵌入损失(CEL)进行训练,以回归到真实目标词的预训练词嵌入。
  • 训练目标结合了标准负对数似然(NLL)损失(用于词预测)与缩放后的嵌入回归损失,其中超参数 λ 控制两者之间的平衡。
  • 模型同时使用两种损失进行联合训练,但在推理阶段仅使用分类预测,从而保持标准 NMT 操作不变。
  • 使用三个不同翻译数据集对方法进行评估:英法、捷克-英和巴斯克-英,且在使用和不使用字节对编码(BPE)的情况下进行测试。
  • 将该方法与强基线及当前最先进系统进行比较,包括使用 dropout、词典偏置和数据自举技术的模型。

实验结果

研究问题

  • RQ1联合预测词语类别与词嵌入是否能提升神经机器翻译中的泛化能力?
  • RQ2回归到预训练词嵌入是否能减少暴露偏差,并提升在未见句子上的性能?
  • RQ3选择嵌入损失(MSE 与 CEL)如何影响训练稳定性和最终性能?
  • RQ4ReWE 是否在不同语言对中均提供一致的性能提升,特别是在低资源设置下?
  • RQ5与当前最先进 NMT 正则化技术相比,ReWE 在 BLEU 分数和鲁棒性方面表现如何?

主要发现

  • ReWE 在三个数据集上均实现稳定提升,相较于强基线模型,BLEU 分数提升范围为 0.91 至 2.54 分。
  • 在除一种配置外的所有设置中,ReWE 均优于 Denkowski 和 Neubig(2017)提出的最先进系统,展现出强大的竞争力。
  • 在巴斯克-英语(eu-en)翻译任务中提升最为显著,BLEU 分数提升达 2.54 分。
  • BPE 在形态丰富的语言(如捷克-英语和巴斯克-英语)中提升了性能,但在英语-法语中未见明显改善,表明其效果具有语言相关性。
  • 余弦嵌入损失(CEL)相比 MSE 展现出更平稳的训练动态,后者在优化器重启时波动较大。
  • 统计显著性检验确认,所有数据集上的性能提升均具有显著性(p < 0.05)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。