[论文解读] Improving Multilingual Neural Machine Translation For Low-Resource Languages: French,English - Vietnamese
本文提出两种简单、与架构无关的方法,以提升低资源法语-越南语和英语-越南语语对的多语言神经机器翻译性能:在共享的多语言空间中动态学习词相似性,以及在训练过程中向罕见词嵌入注入标量调整。该方法相比双语基线模型提升2.54 BLEU,主要得益于基于自学习的合成数据增强技术。
Prior works have demonstrated that a low-resource language pair can benefit from multilingual machine translation (MT) systems, which rely on many language pairs' joint training. This paper proposes two simple strategies to address the rare word issue in multilingual MT systems for two low-resource language pairs: French-Vietnamese and English-Vietnamese. The first strategy is about dynamical learning word similarity of tokens in the shared space among source languages while another one attempts to augment the translation ability of rare words through updating their embeddings during the training. Besides, we leverage monolingual data for multilingual MT systems to increase the amount of synthetic parallel corpora while dealing with the data sparsity problem. We have shown significant improvements of up to +1.62 and +2.54 BLEU points over the bilingual baseline systems for both language pairs and released our datasets for the research community.
研究动机与目标
- 解决低资源多语言神经机器翻译系统中罕见词翻译的挑战。
- 在平行语料有限的条件下,提升法语-越南语和英语-越南语语对的翻译质量。
- 探索通过自学习技术利用单语数据生成合成平行语料的有效性。
- 开发轻量级、非架构依赖的改进方法,以增强罕见词表示,同时不增加模型参数量。
- 发布从TED演讲中构建的新多语言数据集,以支持未来低资源神经机器翻译研究。
提出的方法
- 利用多语言神经机器翻译系统中的跨语言对齐,在共享的多语言嵌入空间中动态学习词相似性,无需依赖双语词典或WordNet等外部资源。
- 在训练过程中对罕见词嵌入引入标量调整,以缓解模型对高频词的偏见,提升其翻译可能性。
- 通过使用前向神经机器翻译模型对单语源端数据进行自学习,生成目标端的合成翻译,从而构建伪双语平行语料。
- 在真实和合成平行数据上微调多语言模型,采用迭代训练以稳定学习过程并提升泛化能力。
- 利用来自TED演讲领域的单语数据,增加训练数据量,缓解低资源场景下的数据稀疏性问题。
- 以多语言Transformer架构作为基础模型,不进行任何架构修改,以确保兼容性与可扩展性。
实验结果
研究问题
- RQ1在多语言嵌入空间中动态学习词相似性,能否提升低资源神经机器翻译系统中罕见词的翻译性能?
- RQ2在不修改模型架构的前提下,向罕见词嵌入中注入标量调整,是否能带来可测量的翻译质量提升?
- RQ3在单语数据上应用自学习,能在多大程度上提升法语-越南语和英语-越南语等低资源语对的多语言神经机器翻译性能?
- RQ4从高资源语对(如法语)生成的合成数据,对低资源目标语对(如越南语)的性能影响如何?
- RQ5轻量级、非参数化的方法是否能在保持模型效率的同时,优于现有罕见词处理方法?
主要发现
- 所提方法在英语→越南语翻译任务中,相比双语基线模型,实现了+2.54 BLEU的提升。
- 在法语→越南语系统中,该方法带来了+1.62 BLEU的增益,表明在两个低资源语对上均实现了稳定改进。
- 利用单语数据进行自学习生成了高质量的合成平行语料,1.2k样本的伪双语数据集在平均模型上达到了18.71 BLEU的性能。
- 在真实与合成数据联合训练的系统中表现出更强的泛化能力,尤其在法语→越南语语对上收益显著。
- 对罕见词嵌入的标量调整显著提升了其翻译可能性,尤其在训练初期效果明显。
- 作者发布了来自TED演讲领域的新型多语言数据集,包含法语-越南语和英语-越南语的平行语料与单语语料,以支持未来研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。