Skip to main content
QUICK REVIEW

[论文解读] Augmenting Neural Machine Translation with Knowledge Graphs

Diego Moussallem, Mihael Arčan|arXiv (Cornell University)|Feb 23, 2019
Natural Language Processing Techniques参考文献 62被引用 16
一句话总结

该论文提出KG-NMT,一种知识图谱增强的神经机器翻译框架,通过在不修改其核心结构的前提下,将知识图谱嵌入(KGE)和实体链接(EL)集成到RNN和Transformer架构中,从而提升实体和术语的翻译性能。该方法在WMT英语-德语翻译基准(2014–2018)上实现了稳定的+3 BLEU、METEOR和chrF3提升,尤其改善了未登录词的翻译效果,其中RNN模型受益程度高于Transformer模型,因其对KGE特征的利用更充分。

ABSTRACT

While neural networks have been used extensively to make substantial progress in the machine translation task, they are known for being heavily dependent on the availability of large amounts of training data. Recent efforts have tried to alleviate the data sparsity problem by augmenting the training data using different strategies, such as back-translation. Along with the data scarcity, the out-of-vocabulary words, mostly entities and terminological expressions, pose a difficult challenge to Neural Machine Translation systems. In this paper, we hypothesize that knowledge graphs enhance the semantic feature extraction of neural models, thus optimizing the translation of entities and terminological expressions in texts and consequently leading to a better translation quality. We hence investigate two different strategies for incorporating knowledge graphs into neural models without modifying the neural network architectures. We also examine the effectiveness of our augmentation method to recurrent and non-recurrent (self-attentional) neural architectures. Our knowledge graph augmented neural translation model, dubbed KG-NMT, achieves significant and consistent improvements of +3 BLEU, METEOR and chrF3 on average on the newstest datasets between 2014 and 2018 for WMT English-German translation task.

研究动机与目标

  • 为解决神经机器翻译(NMT)中持续存在的未登录词(OOV)问题,特别是命名实体和术语表达的翻译挑战。
  • 探究知识图谱(KGs)是否能提升NMT模型的语义特征提取能力,尤其针对罕见或未见的实体。
  • 评估知识图谱增强对循环神经网络(RNN)和非循环(自注意力机制)NMT架构的有效性,且不改变其原始架构。
  • 比较KG增强模型与单语词嵌入和基线NMT系统在BLEU、METEOR和chrF3指标上的性能表现。
  • 分析为何某些架构(如RNN)在KG集成中受益更多,而另一些架构(如Transformer)则不然,尤其关注KGE表征学习的机制。

提出的方法

  • 该方法通过特征拼接的方式,将知识图谱嵌入(KGE)和实体链接(EL)的输出整合到NMT模型的输入表征中,而不修改底层神经网络架构。
  • 评估了两种增强策略:(1) EL + KGE,以及(2) 语义KGE(SemKGE),后者使用知识图谱中特定实体的嵌入表示。
  • 该方法应用于基于词和基于BPE的NMT模型,涵盖RNN和Transformer模型,测试集覆盖多个WMT新闻测试集(2014–2018)。
  • 实体链接将模糊术语映射到知识图谱中的实体,而KGE则提供实体和关系的稠密向量表示,从而丰富输入标记的语义上下文。
  • RNN模型采用ReLU和LSTM激活函数,作者分析了这些激活函数对KGE集成的影响,特别指出在Transformer中使用ReLU会限制KGE特征的有效学习。
  • 评估采用标准指标:BLEU、METEOR和chrF3,并辅以对未登录实体翻译质量的手动分析。

实验结果

研究问题

  • RQ1知识图谱嵌入能否提升神经机器翻译中未登录词(OOV)的翻译性能,特别是命名实体和术语表达?
  • RQ2知识图谱的集成是否能在不同NMT架构(如RNN和Transformer)中带来一致的性能提升?
  • RQ3为何基于RNN的模型在KG增强中受益更多,而基于Transformer的模型则不然,尽管后者整体性能更优?
  • RQ4KG增强的NMT与仅使用单语词嵌入的模型相比,在实体翻译质量方面表现如何?
  • RQ5不同的KG集成策略(EL+KGE与SemKGE)在翻译性能和OOV词处理方面的影响有多大?

主要发现

  • KG-NMT在WMT 2014–2018年英语-德语新闻测试集上,平均实现了+3 BLEU、METEOR和chrF3的稳定提升,表明其性能增益显著且一致。
  • 基于RNN的KG-NMT(SemKGE)模型在所有测试集上均优于Transformer基线模型,尤其在newstest2018上达到30.55 BLEU的翻译性能。
  • Transformer模型在KG增强后的性能反而低于其基线,表明ReLU激活函数可能阻碍自注意力机制中KGE特征的有效学习。
  • 人工评估确认,KG-NMT能正确翻译如'UK'和'Coastguard'等实体,而基线模型则出现错误;而单语词嵌入错误地将'Principal'翻译为'Wichtigste'。
  • SemKGE策略优于EL+KGE和单语词嵌入,表明针对特定实体的KGE表征在OOV词翻译中更具有效性。
  • 研究发现,单语词嵌入与KGE在整体指标上无显著差异,但人工分析显示单语词嵌入在实体翻译上失败,而KGE成功,凸显了实体感知知识的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。