Skip to main content
QUICK REVIEW

[论文解读] Data Augmentation to Address Out-of-Vocabulary Problem in Low-Resource Sinhala-English Neural Machine Translation

Aloka Fernando, Surangika Ranathunga|arXiv (Cornell University)|May 18, 2022
Natural Language Processing Techniques被引用 6
一句话总结

本文提出了一种针对低资源僧伽罗语-英语神经机器翻译(NMT)的新型数据增强(DA)技术,通过在保留句法和语义约束的前提下替换词语和短语,同时解决罕见词和未登录词(OOV)问题。该方法提升了翻译性能,仅使用语义约束即可获得与句法约束相当的结果,而结合两者时性能进一步提升——尤其对缺乏语言工具的低资源语言而言具有重要意义。

ABSTRACT

Out-of-Vocabulary (OOV) is a problem for Neural Machine Translation (NMT). OOV refers to words with a low occurrence in the training data, or to those that are absent from the training data. To alleviate this, word or phrase-based Data Augmentation (DA) techniques have been used. However, existing DA techniques have addressed only one of these OOV types and limit to considering either syntactic constraints or semantic constraints. We present a word and phrase replacement-based DA technique that consider both types of OOV, by augmenting (1) rare words in the existing parallel corpus, and (2) new words from a bilingual dictionary. During augmentation, we consider both syntactic and semantic properties of the words to guarantee fluency in the synthetic sentences. This technique was experimented with low resource Sinhala-English language pair. We observe with only semantic constraints in the DA, the results are comparable with the scores obtained considering syntactic constraints, and is favourable for low-resourced languages that lacks linguistic tool support. Additionally, results can be further improved by considering both syntactic and semantic constraints.

研究动机与目标

  • 解决低资源僧伽罗语-英语神经机器翻译(NMT)中的未登录词(OOV)问题。
  • 开发一种数据增强技术,同时处理训练数据中的罕见词以及来自双语词典的全新OOV词。
  • 通过在词语/短语替换过程中联合考虑句法和语义约束,确保增强后句子的流畅性。
  • 评估在语言工具支持有限的低资源环境下,仅使用语义约束、仅使用句法约束以及两者结合的约束方式在翻译质量上的有效性。
  • 证明仅使用语义约束即可获得具有竞争力的结果,从而降低对复杂句法工具的依赖,尤其适用于低资源语言。

提出的方法

  • 该方法利用双语词典在平行句对中执行词语和短语替换,以引入新的OOV词。
  • 通过词嵌入应用语义约束,确保替换后的词语与原词在语义上相近。
  • 通过词性(POS)标注应用句法约束,以保持增强后句子的语法正确性。
  • 增强过程生成的合成平行句对在语义和语法结构上均得以保留。
  • 该方法在低资源僧伽罗语-英语NMT设置下进行评估,采用标准BLEU分数作为指标。
  • 分别单独应用和联合应用语义与句法约束,以评估其对翻译质量的影响。

实验结果

研究问题

  • RQ1能否通过增强罕见词和未见词的数据增强技术,有效缓解低资源僧伽罗语-英语NMT中的未登录词(OOV)问题?
  • RQ2在低资源环境下,仅使用语义约束与仅使用句法约束相比,在保持流畅性和翻译质量方面表现如何?
  • RQ3与单独使用任一约束类型相比,联合使用句法和语义约束在多大程度上提升了翻译性能?
  • RQ4基于语义相似性的数据增强方法是否能在不依赖复杂句法工具(这些工具通常对低资源语言不可用)的情况下取得具有竞争力的结果?

主要发现

  • 仅使用语义约束进行数据增强即可获得与使用句法约束相当的BLEU分数,证明了纯语义方法的可行性。
  • 句法与语义约束的结合进一步提升了翻译性能,表明两者具有叠加增益效果。
  • 该方法通过有意义且流畅的替换方式,有效缓解了OOV问题,成功引入了罕见词和未见词。
  • 该方法对低资源语言(如僧伽罗语)尤其有效,因为此类语言通常缺乏POS标注器和解析器等语言资源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。