[论文解读] Merging External Bilingual Pairs into Neural Machine Translation
本文提出一种数据驱动的方法,通过在训练数据中引入标注、混合短语和额外嵌入,将预定义的双语短语对整合到神经机器翻译(NMT)系统中,而无需修改NMT架构或解码速度,实现了对指定短语超过99%的翻译准确率。
As neural machine translation (NMT) is not easily amenable to explicit correction of errors, incorporating pre-specified translations into NMT is widely regarded as a non-trivial challenge. In this paper, we propose and explore three methods to endow NMT with pre-specified bilingual pairs. Instead, for instance, of modifying the beam search algorithm during decoding or making complex modifications to the attention mechanism --- mainstream approaches to tackling this challenge ---, we experiment with the training data being appropriately pre-processed to add information about pre-specified translations. Extra embeddings are also used to distinguish pre-specified tokens from the other tokens. Extensive experimentation and analysis indicate that over 99% of the pre-specified phrases are successfully translated (given a 85% baseline) and that there is also a substantive improvement in translation quality with the methods explored here.
研究动机与目标
- 为解决将预定义的双语短语对集成到端到端NMT系统中的挑战,此类系统难以进行显式错误修正。
- 使NMT能够可靠地将特定多词表达(如品牌名称)按照外部数据库中的定义进行翻译,确保高准确率和一致性。
- 开发一种方法,在不修改NMT模型架构或束搜索算法的前提下,提升预定义短语的翻译质量。
- 在显著提高固定双语表达翻译成功率的同时,保持解码速度不变。
- 探索一种可扩展、可复现且有效的方法,通过训练数据预处理将外部语言知识注入NMT系统。
提出的方法
- 标注方法:使用<start>和<end>特殊标记将源语句中的短语及其目标语言翻译括起来,形成NMT模型可学习的关联模式。
- 混合短语方法:通过在源语句中直接附加该短语的目标语言翻译(例如,'我 爱 香港 hong kong'),增强模型的复制学习能力。
- 额外嵌入方法:引入一个专用的嵌入向量,以区分预定义短语与普通标记,提供比标注更柔和的信号。
- 组合方法:结合使用标注与混合短语,可选地使用<middle>标记分隔混合短语中的源语与目标语,以改善对齐学习。
- 标签与目标短语之间共享嵌入,有助于模型通过更强的注意力信号学习跨语言对应关系。
- 所有方法均在数据预处理阶段应用,无需修改NMT模型或解码算法,从而保持推理速度。
实验结果
研究问题
- RQ1是否仅通过数据级修改,即可有效训练NMT模型,以高准确率翻译特定预定义的双语短语?
- RQ2与基线NMT相比,结合标注、混合短语和额外嵌入是否能显著提升短语翻译的成功率?
- RQ3所提出的方法是否能在不降低解码速度的前提下,实现对词级和多词短语翻译的高准确率?
- RQ4各个组件(标注、混合短语、额外嵌入)对整体短语翻译性能提升的贡献如何?
- RQ5该方法在不同语种对和领域(如中英、英德新闻翻译)中是否具有鲁棒性?
主要发现
- 在中英翻译任务中,预定义短语的翻译成功率从基线的74.19%(句级)提升至98.40%,从85.03%(短语级)提升至99.13%。
- 在中英翻译任务中,该方法相比基线模型(BLEU为45.7)实现了1.4个BLEU点的提升。
- 在英德翻译任务中,使用所提方法后,短语级成功率从基线的93.69%提升至99.54%。
- 标注方法通过创建可学习的复制模式,增强了注意力机制;共享嵌入则加强了跨语言对齐。
- 额外嵌入方法提供了比标注更柔和、干扰更小的信号,尽管性能增益相对较小。
- 该方法在不修改NMT模型或解码过程的前提下,实现了对预定义短语超过99%的翻译成功率,同时保持了推理速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。