Skip to main content
QUICK REVIEW

[论文解读] Merging External Bilingual Pairs into Neural Machine Translation

Tao Wang, Shaohui Kuang|arXiv (Cornell University)|Dec 2, 2019
Natural Language Processing Techniques参考文献 22被引用 6
一句话总结

本文提出一种数据驱动的方法,通过在训练数据中引入标注、混合短语和额外嵌入,将预定义的双语短语对整合到神经机器翻译(NMT)系统中,而无需修改NMT架构或解码速度,实现了对指定短语超过99%的翻译准确率。

ABSTRACT

As neural machine translation (NMT) is not easily amenable to explicit correction of errors, incorporating pre-specified translations into NMT is widely regarded as a non-trivial challenge. In this paper, we propose and explore three methods to endow NMT with pre-specified bilingual pairs. Instead, for instance, of modifying the beam search algorithm during decoding or making complex modifications to the attention mechanism --- mainstream approaches to tackling this challenge ---, we experiment with the training data being appropriately pre-processed to add information about pre-specified translations. Extra embeddings are also used to distinguish pre-specified tokens from the other tokens. Extensive experimentation and analysis indicate that over 99% of the pre-specified phrases are successfully translated (given a 85% baseline) and that there is also a substantive improvement in translation quality with the methods explored here.

研究动机与目标

  • 为解决将预定义的双语短语对集成到端到端NMT系统中的挑战,此类系统难以进行显式错误修正。
  • 使NMT能够可靠地将特定多词表达(如品牌名称)按照外部数据库中的定义进行翻译,确保高准确率和一致性。
  • 开发一种方法,在不修改NMT模型架构或束搜索算法的前提下,提升预定义短语的翻译质量。
  • 在显著提高固定双语表达翻译成功率的同时,保持解码速度不变。
  • 探索一种可扩展、可复现且有效的方法,通过训练数据预处理将外部语言知识注入NMT系统。

提出的方法

  • 标注方法:使用<start>和<end>特殊标记将源语句中的短语及其目标语言翻译括起来,形成NMT模型可学习的关联模式。
  • 混合短语方法:通过在源语句中直接附加该短语的目标语言翻译(例如,'我 爱 香港 hong kong'),增强模型的复制学习能力。
  • 额外嵌入方法:引入一个专用的嵌入向量,以区分预定义短语与普通标记,提供比标注更柔和的信号。
  • 组合方法:结合使用标注与混合短语,可选地使用<middle>标记分隔混合短语中的源语与目标语,以改善对齐学习。
  • 标签与目标短语之间共享嵌入,有助于模型通过更强的注意力信号学习跨语言对应关系。
  • 所有方法均在数据预处理阶段应用,无需修改NMT模型或解码算法,从而保持推理速度。

实验结果

研究问题

  • RQ1是否仅通过数据级修改,即可有效训练NMT模型,以高准确率翻译特定预定义的双语短语?
  • RQ2与基线NMT相比,结合标注、混合短语和额外嵌入是否能显著提升短语翻译的成功率?
  • RQ3所提出的方法是否能在不降低解码速度的前提下,实现对词级和多词短语翻译的高准确率?
  • RQ4各个组件(标注、混合短语、额外嵌入)对整体短语翻译性能提升的贡献如何?
  • RQ5该方法在不同语种对和领域(如中英、英德新闻翻译)中是否具有鲁棒性?

主要发现

  • 在中英翻译任务中,预定义短语的翻译成功率从基线的74.19%(句级)提升至98.40%,从85.03%(短语级)提升至99.13%。
  • 在中英翻译任务中,该方法相比基线模型(BLEU为45.7)实现了1.4个BLEU点的提升。
  • 在英德翻译任务中,使用所提方法后,短语级成功率从基线的93.69%提升至99.54%。
  • 标注方法通过创建可学习的复制模式,增强了注意力机制;共享嵌入则加强了跨语言对齐。
  • 额外嵌入方法提供了比标注更柔和、干扰更小的信号,尽管性能增益相对较小。
  • 该方法在不修改NMT模型或解码过程的前提下,实现了对预定义短语超过99%的翻译成功率,同时保持了推理速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。