Skip to main content
QUICK REVIEW

[论文解读] How do lexical semantics affect translation? An empirical study

Vivek Subramanian, Dhanasekar Sundararaman|arXiv (Cornell University)|Dec 31, 2021
Natural Language Processing Techniques被引用 4
一句话总结

本文研究了词汇语义——特别是词序和词汇相似性——如何影响神经机器翻译(NMT)性能。基于 OpenSubtitles2016 数据集中 15 个以英语为源语言的低资源语言对,研究发现翻译性能随目标语言与英语的词汇相似性提高而提升,且词性(POS)标注监督在词序与英语差异较大的语言中显著提升了性能,尤其在 Transformer 模型中表现明显。

ABSTRACT

Neural machine translation (NMT) systems aim to map text from one language into another. While there are a wide variety of applications of NMT, one of the most important is translation of natural language. A distinguishing factor of natural language is that words are typically ordered according to the rules of the grammar of a given language. Although many advances have been made in developing NMT systems for translating natural language, little research has been done on understanding how the word ordering of and lexical similarity between the source and target language affect translation performance. Here, we investigate these relationships on a variety of low-resource language pairs from the OpenSubtitles2016 database, where the source language is English, and find that the more similar the target language is to English, the greater the translation performance. In addition, we study the impact of providing NMT models with part of speech of words (POS) in the English sequence and find that, for Transformer-based models, the more dissimilar the target language is from English, the greater the benefit provided by POS.

研究动机与目标

  • 理解词汇语义(尤其是词序与词汇相似性)如何影响神经机器翻译(NMT)性能。
  • 评估在 NMT 模型的源端标记中,将词性(POS)标注作为显式语言学监督对性能的影响。
  • 比较 LSTM 与 Transformer 架构在处理多样化语言类型时的翻译表现。
  • 评估源语言与目标语言之间的语言相似性是否会影响低资源环境下的翻译质量。
  • 确定词性监督是否对与英语句法结构差异较大的语言带来更大收益。

提出的方法

  • 基于 OpenSubtitles2016 数据集中的 15 个低资源语言对,以英语为源语言,开展实证研究。
  • 训练基于 LSTM 和 Transformer 的 NMT 模型,分别在源端标记中是否加入显式词性(POS)标注。
  • 对源语言和目标语言均使用共享子词词汇表的字节对编码(BPE)。
  • 按照 Sennrich 和 Haddow(2016)以及 Sundararaman 等人(2019)的方法,在子词标记嵌入后附加可学习的 POS 嵌入向量。
  • 通过在保留的测试集上计算 BLEU 分数,评估各语言对的翻译质量。
  • 根据目标语言的主导词序(SVO、SOV 或灵活)进行分类,并计算目标语言与英语之间的归一化 Levenshtein 距离以衡量词汇相似性。

实验结果

研究问题

  • RQ1目标语言的句法词序(如 SVO 与 SOV)如何影响 NMT 模型的翻译性能?
  • RQ2英语与目标语言之间的词汇相似性在低资源 NMT 中在多大程度上影响 BLEU 分数?
  • RQ3向源端解码器提供词性(POS)信息是否能提升翻译性能,尤其是在与英语词序差异较大的语言中?
  • RQ4LSTM 与 Transformer 架构在对词序与词汇相似性等语言差异的敏感性方面有何不同?
  • RQ5在低资源、语言类型差异较大的语言对上,POS 监督的收益是否更加显著?

主要发现

  • 翻译性能(以 BLEU 分数衡量)随英语与目标语言之间词汇相似性的提高而提升,表现为归一化 Levenshtein 距离降低。
  • 对于基于 Transformer 的模型,POS 监督在与英语 SVO 结构差异最大的语言中收益最为显著,如僧伽罗语(SOV)和巴斯克语(灵活/SOV)。
  • LSTM 模型中加入 POS 标注后,在印地语(SOV)上的 BLEU 分数为 22.26,与基线 LSTM 模型相同,表明改进微弱;而 Transformer 模型在相同语言上的 BLEU 分数从 23.80 提升至 24.15,表明收益显著。
  • Transformer 模型在加了 POS 标注后,对加泰罗尼亚语(SVO)的 BLEU 分数达到 29.23,较基线模型(27.30)提升了 1.93 分,表明在词序相似的语言中收益显著。
  • 对于高度不同的语言如巴斯克语(Levenshtein 距离为 0.407),Transformer 模型在加入 POS 标注后 BLEU 分数从 16.60 提升至 17.80,提升 1.2 分,表明 POS 标注有助于弥合句法差异。
  • 本研究证实,词序与词汇相似性等语言特征是影响 NMT 性能的关键因素,尤其在低资源环境下;且 POS 监督可有效缓解结构差异较大的语言对中的性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。