[论文解读] Translating Terminological Expressions in Knowledge Bases with Neural Machine Translation
本文评估了神经机器翻译(NMT)与统计机器翻译(SMT)在将医学(ICD)和金融(IFRS)本体中的高度领域特定术语翻译成德语时的表现。结果表明,仅使用术语表达进行领域自适应可显著提升翻译质量,其中NMT在领域特定标签上的表现优于SMT,且子词模型在术语翻译方面优于词基模型。
Our work presented in this paper focuses on the translation of terminological expressions represented in semantically structured resources, like ontologies or knowledge graphs. The challenge of translating ontology labels or terminological expressions documented in knowledge bases lies in the highly specific vocabulary and the lack of contextual information, which can guide a machine translation system to translate ambiguous words into the targeted domain. Due to these challenges, we evaluate the translation quality of domain-specific expressions in the medical and financial domain with statistical as well as with neural machine translation methods and experiment domain adaptation of the translation models with terminological expressions only. Furthermore, we perform experiments on the injection of external terminological expressions into the translation systems. Through these experiments, we observed a significant advantage in domain adaptation for the domain-specific resource in the medical and financial domain and the benefit of subword models over word-based neural machine translation models for terminology translation.
研究动机与目标
- 评估神经机器翻译与统计机器翻译在知识库中领域特定术语表达翻译中的有效性。
- 研究仅使用术语表达进行领域自适应是否能提升医学与金融本体的翻译质量。
- 评估将外部术语知识(如来自维基百科的内容)注入翻译模型对低资源、领域特定术语翻译的影响。
- 比较子词基NMT模型与词基NMT模型在翻译罕见、领域特定术语时的表现。
- 识别改进语义结构化资源(如本体与知识图谱)翻译质量的最优策略。
提出的方法
- 在通用平行语料库上训练神经机器翻译(NMT)与统计机器翻译(SMT)模型,用于英德翻译任务。
- 通过仅使用ICD与IFRS本体中的领域特定术语表达,对模型进行微调以实现领域自适应。
- 通过基于词汇重叠或嵌入相似性的方法,将维基百科标题与摘要中的外部知识注入翻译过程,赋予翻译概率。
- 使用单字替换与词汇对齐技术,将外部术语注入NMT系统,其中概率通过词嵌入之间的余弦相似度进行调整。
- 通过在领域内测试集与开发集上的BLEU分数评估翻译质量,比较通用模型、自适应模型与注入知识的变体。
- 比较子词NMT(sentencepiece)与词基NMT及SMT,以评估其在处理未登录词(OOV)术语时的表现。
实验结果
研究问题
- RQ1仅使用术语表达进行领域自适应是否能提升医学与金融本体标签的翻译质量?
- RQ2在翻译孤立的、领域特定术语时,神经机器翻译与统计机器翻译相比表现如何?
- RQ3将外部术语知识(如来自维基百科)注入对领域特定表达的翻译性能有何影响?
- RQ4子词NMT在翻译罕见、领域特定术语时是否优于词基NMT?
- RQ5当目标领域的词汇与通用语料库存在显著差异时,外部知识注入能否提升翻译质量?
主要发现
- 仅使用ICD与IFRS本体中的术语表达进行领域自适应,显著提升了NMT与SMT的翻译质量,其中NMT在领域特定标签上的表现更优。
- 子词NMT模型在翻译领域特定术语方面优于词基NMT模型,尤其体现在对未登录词(OOV)的更好处理能力。
- 对于ICD本体,将领域内开发集的翻译结果注入后,NMT的BLEU分数从8.05提升至10.41(提升3分),而维基百科注入则导致性能下降(从8.05降至5.03)。
- 对于IFRS本体,注入领域内开发集使BLEU分数从SMT的14.66提升至NMT的29.69,表明领域内自适应带来了显著增益。
- 从维基百科注入外部知识的收益极小:ICD的BLEU从6.39降至5.03,IFRS的BLEU从10.54降至10.51,表明维基百科词汇与领域特定术语之间存在严重不匹配。
- 在1,000个ICD术语中仅有23个与维基百科知识库中的术语对完全匹配,IFRS本体中仅1个术语匹配,证实通用资源与领域特定资源之间存在显著词汇差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。