Skip to main content
QUICK REVIEW

[论文解读] Dictionary-based Data Augmentation for Cross-Domain Neural Machine Translation

Wei Peng, Chongxuan Huang|arXiv (Cornell University)|Apr 6, 2020
Natural Language Processing Techniques参考文献 21被引用 14
一句话总结

本文提出基于词典的数据增强(DDA)方法,用于跨领域神经机器翻译,该方法利用领域特定词典和域外(OOD)双语语料,自动构建大规模伪域内(IND)平行语料。该方法通过增强领域覆盖度显著提升翻译性能,在基线模型基础上实现3.75–11.53 BLEU的提升,并与回译技术形成互补。

ABSTRACT

Existing data augmentation approaches for neural machine translation (NMT) have predominantly relied on back-translating in-domain (IND) monolingual corpora. These methods suffer from issues associated with a domain information gap, which leads to translation errors for low frequency and out-of-vocabulary terminology. This paper proposes a dictionary-based data augmentation (DDA) method for cross-domain NMT. DDA synthesizes a domain-specific dictionary with general domain corpora to automatically generate a large-scale pseudo-IND parallel corpus. The generated pseudo-IND data can be used to enhance a general domain trained baseline. The experiments show that the DDA-enhanced NMT models demonstrate consistent significant improvements, outperforming the baseline models by 3.75-11.53 BLEU. The proposed method is also able to further improve the performance of the back-translation based and IND-finetuned NMT models. The improvement is associated with the enhanced domain coverage produced by DDA.

研究动机与目标

  • 解决因可用域内(IND)平行语料有限以及现有数据增强方法中缺乏领域信息,导致神经机器翻译中的领域不匹配问题。
  • 克服回译和单语数据增强方法的局限性,这些方法无法充分覆盖专业领域中的罕见或未登录术语。
  • 开发一种实用且可扩展的方法,用于生成大规模伪IND平行语料,而无需依赖IND单语语料。
  • 将词典中全面的领域特定术语整合到训练数据中,以提高低频词和未登录词的翻译准确性。
  • 证明基于词典的增强是回译在跨领域NMT中的一种可行且互补的替代方案。

提出的方法

  • 该方法利用广泛可用的领域词典(如SNOMED-CT)和通用领域单语语料,构建领域特定的双语词典。
  • 通过将域外双语语料中的句子用词典中的领域特定术语进行替换,自动生成大规模伪IND平行语料,同时保持句法和结构模式。
  • 该方法采用基于词典的替换机制,将域外双语语料中的词语或短语替换为词典中对应的领域特定翻译,确保语言上的合理性。
  • 通过生成数据、测试集与IND词典之间的n-gram匹配来量化增强领域覆盖度(ED),ED定义为同时出现在数据和测试集中且来自词典的唯一1–5元短语数量。
  • 该方法应用于在域外平行语料上微调的一般领域NMT模型,可与回译技术结合以获得进一步提升。
  • 该方法在新闻和医疗领域中针对四个翻译方向(EN↔FR,EN↔DE)进行评估,使用BLEU分数和领域覆盖度分析。

实验结果

研究问题

  • RQ1在不依赖域内单语语料的前提下,基于词典的数据增强是否能有效提升跨领域NMT性能?
  • RQ2在罕见和未登录领域术语的覆盖度方面,DDA与回译相比表现如何?
  • RQ3增强领域覆盖度(ED)在多大程度上与DDA增强模型的BLEU分数提升相关?
  • RQ4DDA能否通过生成回译未捕捉到的、具有高覆盖度的特定领域短语,与回译形成互补?
  • RQ5IND词典的规模是否直接影响DDA增强NMT模型的性能增益?

主要发现

  • DDA增强的NMT模型在四个翻译方向上均显著优于基线模型,BLEU分数提升范围为3.75至11.53。
  • 性能提升与增强领域覆盖度(ED)密切相关,更大的IND词典带来更高的ED和更好的BLEU分数。
  • DDA生成的领域术语范围广于回译,尤其在4元短语如“Lower respiratory tract infection”和“Renal artery stenosis”方面,这些短语未被回译捕捉。
  • 与回译相比,DDA-G(DDA生成的数据)额外捕捉了45个IND术语,尤其在4元短语分布上表现突出,表明其对复杂术语的覆盖能力更优。
  • 当与回译结合使用时,DDA进一步提升性能,证明其作为互补数据增强策略的有效性。
  • 该方法成功将全面的领域特定术语整合到训练数据中,显著减少了专业领域中罕见词和未登录词的翻译错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。