Skip to main content
QUICK REVIEW

[论文解读] When and Why are Pre-trained Word Embeddings Useful for Neural Machine Translation?

Qi Ye, Devendra Singh Sachan|arXiv (Cornell University)|Apr 17, 2018
Natural Language Processing Techniques参考文献 8被引用 18
一句话总结

本文研究了在低资源环境下,预训练词嵌入在何时以及为何能提升神经机器翻译(NMT)性能。基于TED演讲的受控多语言数据集,研究发现预训练嵌入可使BLEU分数最高提升20分,尤其在训练数据稀缺且源语言与目标语言在语言上相似时效果显著。收益在罕见词和低频词上最为明显,表明即使在端到端NMT系统中,预训练也能增强表征学习能力。

ABSTRACT

The performance of Neural Machine Translation (NMT) systems often suffers in low-resource scenarios where sufficiently large-scale parallel corpora cannot be obtained. Pre-trained word embeddings have proven to be invaluable for improving performance in natural language analysis tasks, which often suffer from paucity of data. However, their utility for NMT has not been extensively explored. In this work, we perform five sets of experiments that analyze when we can expect pre-trained word embeddings to help in NMT tasks. We show that such embeddings can be surprisingly effective in some cases -- providing gains of up to 20 BLEU points in the most favorable setting.

研究动机与目标

  • 确定在何种条件下预训练词嵌入能提升低资源场景下的NMT性能。
  • 研究源语言与目标语言之间的语言相似性对嵌入实用性的影响力。
  • 评估对齐嵌入空间是否能提升多语言设置下的翻译质量。
  • 分析训练数据量对预训练嵌入有效性的影响。
  • 评估预训练嵌入在多语言NMT系统与双语NMT系统中的相对优势。

提出的方法

  • 从TED演讲中构建了一个多语言平行语料库,涵盖6对语言,涉及三种语言族(罗曼语族、突厥语族、斯拉夫语族)。
  • 使用标准的一层编码器-解码器NMT模型,配备注意力机制和束搜索,采用Adam优化器和学习率衰减进行训练。
  • 将嵌入层初始化为来自Wikipedia的预训练fastText词向量(300维),并与Glorot均匀初始化作为基线进行对比。
  • 设计五组实验以评估:(1) 语言族的影响,(2) 数据量的影响,(3) 语言相似性,(4) 嵌入空间对齐,(5) 多语言与双语设置的差异。
  • 使用BLEU分数评估模型性能,并对翻译输出和n-gram生成模式进行定性分析。
  • 使用f-measure评估词级翻译准确性,按训练数据中的词频进行分桶。

实验结果

研究问题

  • RQ1Q1:预训练行为在不同语言族和语言特征下是否存在差异?
  • RQ2Q2:当训练数据量较小时,预训练嵌入是否能带来更大收益?
  • RQ3Q3:源语言与目标语言之间的语言相似性如何影响嵌入的有效性?
  • RQ4Q4:对齐源语言与目标语言的嵌入空间是否有利于NMT?
  • RQ5Q5:预训练嵌入在多语言系统中是否比在双语系统中更有效?

主要发现

  • 在最有利的设置下,预训练嵌入使BLEU分数最高提升20.0分,具体体现在Gl → En方向(从2.2提升至13.2)。
  • 最大收益出现在低资源设置中,如加利西亚语-英语(11.0分BLEU提升),此时训练数据极少(仅10,000句)。
  • 预训练对低频词和罕见词最有效,所有频率分桶中均观察到f-measure提升,尤其在最低频分桶中最为显著。
  • 使用预训练嵌入的模型生成了更多语法正确且语义准确的翻译,能正确处理命名实体(如“Chris”)和多词短语(如“patent legislation”)。
  • 在多语言设置中,结合预训练与嵌入空间对齐的模型性能最高,表明在共享嵌入场景下对齐具有显著益处。
  • 即使是功能词如介词和连词(如“with”、“and”)也因使用预训练嵌入而生成得更准确,表明其在句法和语义层面具有更广泛的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。