[论文解读] Neural Name Translation Improves Neural Machine Translation
本文提出一种基于字符级别的序列到序列神经网络,用于命名实体(NE)翻译,以提升神经机器翻译(NMT)系统性能。通过在外部命名实体列表上训练命名实体翻译器,并利用其在双语平行语料中生成高质量的命名实体对齐,该方法提升了训练数据质量并增强了NMT性能,在中文到英文翻译任务中相比基线模型实现了2.9个BLEU分数的提升。
In order to control computational complexity, neural machine translation (NMT) systems convert all rare words outside the vocabulary into a single unk symbol. Previous solution (Luong et al., 2015) resorts to use multiple numbered unks to learn the correspondence between source and target rare words. However, testing words unseen in the training corpus cannot be handled by this method. And it also suffers from the noisy word alignment. In this paper, we focus on a major type of rare words -- named entity (NE), and propose to translate them with character level sequence to sequence model. The NE translation model is further used to derive high quality NE alignment in the bilingual training corpus. With the integration of NE translation and alignment modules, our NMT system is able to surpass the baseline system by 2.9 BLEU points on the Chinese to English task.
研究动机与目标
- 解决NMT系统在处理罕见词(尤其是命名实体NE)时的局限性,这些词通常被替换为单一的'unk'标记。
- 克服先前方法依赖噪声较大的词对齐和词典查找来处理罕见词翻译的不足。
- 通过使用神经命名实体翻译模型生成高精度的命名实体对齐,提升NMT训练数据的质量。
- 将命名实体翻译与对齐模块整合进NMT流程,以提升整体翻译性能。
- 通过利用基于字符的建模方法和外部命名实体资源,实现对未见罕见词的有效翻译。
提出的方法
- 使用注意力机制训练一个基于字符的序列到序列模型,利用外部命名实体列表将命名实体从源语言翻译为目标语言。
- 使用训练好的命名实体翻译器和命名实体识别器,在双语平行语料中识别并对齐命名实体对。
- 将训练数据中对齐的命名实体替换为类型符号(如LOC1、LOC2),以生成经过优化的NMT训练数据集。
- 使用基于注意力机制的编码器-解码器架构,在符号替换后的平行语句上训练标准NMT模型。
- 推理阶段,识别输入中的命名实体,将其替换为类型符号,使用NMT模型进行翻译,随后通过命名实体翻译器替换为预测的命名实体翻译结果。
- 应用后处理步骤:对已知命名实体使用词典表进行替换,对未知命名实体则回退至神经命名实体模型,以提升准确性。
实验结果
研究问题
- RQ1基于字符的神经序列到序列模型在低资源和罕见词场景下,如何提升命名实体翻译性能?
- RQ2由神经命名实体翻译器生成的高质量命名实体对齐,对NMT训练数据质量有何影响?
- RQ3将命名实体翻译与对齐模块整合是否能在低资源语言对上带来可测量的NMT性能提升?
- RQ4与Luong等人(2015)的方法相比,该方法在处理罕见词和未见实体时表现如何?
- RQ5使用外部命名实体列表和神经对齐方法是否能提升模型在已见训练样本之外的鲁棒性与泛化能力?
主要发现
- 所提方法在中文到英文的NMT任务中,相比基线系统提升了2.9个BLEU分数。
- 将命名实体替换与Luong等人方法结合,可额外获得0.75个BLEU分数的提升,最终实现相比基线2.9个BLEU分数的改进。
- 命名实体翻译模型在人物、地点和其他类型命名实体上的词级别准确率分别为0.71、0.28和0.35,通过引入词典表进一步提升了性能。
- 命名实体对齐性能达到人物97%、地点93%、其他类型96%,表明对齐流程具有高度可靠性。
- 在相同中文-英文任务上,该方法相比Luong等人方法提升了1.6个BLEU分数,证明其在处理罕见词方面更具优势。
- 高对齐准确率表明该方法减少了自动词对齐带来的噪声,尤其对中文-英文等低资源语言对具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。