[论文解读] Adapting Multilingual Neural Machine Translation to Unseen Languages
本文提出了一种基于困惑度的数据选择方法与动态词汇表自适应机制,以在无需任何低资源语言(LRL)平行语料的情况下,提升多语言神经机器翻译(MNMT)在低资源语言上的表现。通过利用语言模型的困惑度,选择与目标LRL最相似的高资源语言(HRL)语料,并动态扩展模型的词汇表,该方法在零样本和微调设置下实现了最高+17.0 BLEU的性能提升,优于以往方法,包括数据增强和静态自适应方法。
Multilingual Neural Machine Translation (MNMT) for low-resource languages (LRL) can be enhanced by the presence of related high-resource languages (HRL), but the relatedness of HRL usually relies on predefined linguistic assumptions about language similarity. Recently, adapting MNMT to a LRL has shown to greatly improve performance. In this work, we explore the problem of adapting an MNMT model to an unseen LRL using data selection and model adaptation. In order to improve NMT for LRL, we employ perplexity to select HRL data that are most similar to the LRL on the basis of language distance. We extensively explore data selection in popular multilingual NMT settings, namely in (zero-shot) translation, and in adaptation from a multilingual pre-trained model, for both directions (LRL-en). We further show that dynamic adaptation of the model's vocabulary results in a more favourable segmentation for the LRL in comparison with direct adaptation. Experiments show reductions in training time and significant performance gains over LRL baselines, even with zero LRL data (+13.0 BLEU), up to +17.0 BLEU for pre-trained multilingual model dynamic adaptation with related data selection. Our method outperforms current approaches, such as massively multilingual models and data augmentation, on four LRL.
研究动机与目标
- 在无任何平行训练语料的情况下,提升多语言神经机器翻译(MNMT)在低资源语言(LRLs)上的表现。
- 通过使用困惑度作为数据选择标准,减少对语言相似性预设语言学假设的依赖。
- 通过动态调整模型词汇表,提升翻译性能,以更好地处理形态丰富的LRLs。
- 在零样本翻译(无LRL数据)和自适应场景(使用选定的HRL数据)下,评估该方法的有效性。
- 在低资源翻译任务中,超越现有方法,如数据增强和静态自适应。
提出的方法
- 使用在目标LRL上训练的语言模型,计算其在可用高资源语言(HRL)单语语料上的困惑度分数,以识别最相似的HRL。
- 选择困惑度最低的HRL语料作为与未见LRL最相关的语料用于自适应。
- 使用选定的HRL语料对预训练的多语言NMT模型进行自适应,比较两种策略:直接自适应(DirAdapt)与动态词汇表扩展(DynAdapt)。
- 通过调节分词大小,动态调整模型的子词分词机制,以更好地适应形态丰富的LRLs。
- 在两个方向(LRL ↔ 英语)上进行模型训练与评估,包括在训练过程中完全不使用LRL数据的零样本翻译。
- 采用Transformer架构,在包含58种语言的TED Talks数据集上进行实验,重点关注四种LRL:阿塞拜疆语、白俄罗斯语、加利西亚语和斯洛伐克语。
实验结果
研究问题
- RQ1基于困惑度的数据选择是否能优于基于启发式或随机选择的高资源语言,用于将多语言NMT自适应到未见的低资源语言?
- RQ2与静态自适应相比,动态词汇表自适应是否能显著提升低资源语言的翻译质量?
- RQ3在无平行语料的零样本翻译场景下,该方法的有效性如何,即在训练期间未使用目标语言数据?
- RQ4基于困惑度的数据选择与动态自适应的结合,是否能显著提升BLEU性能,超越现有的数据增强与自适应技术?
- RQ5该方法在不同语系和形态类型的语言中是否具备鲁棒性,特别是对形态丰富的低资源语言?
主要发现
- 基于困惑度的数据选择在从预训练多语言模型进行自适应时,相较于基线模型,最高实现了+17.0 BLEU的性能提升,尤其在具有挑战性的 en→LRL 方向表现突出。
- 在零样本翻译(无LRL数据)中,该方法实现了+13.0 BLEU的性能提升,表明即使未进行微调,也具备强大的跨语言迁移能力。
- 动态词汇表自适应(DynAdapt)优于直接自适应(DirAdapt),尤其在形态丰富的语言上,因其能实现更优的子词分词效果。
- 该方法在提升性能的同时缩短了训练时间,展现出性能与效率的双重提升。
- 在所有四种测试的低资源语言上,该方法均优于当前最先进方法,包括数据增强和大规模多语言模型。
- 性能提升在 en→LRL 方向最为显著,这通常受限于目标语言侧数据稀疏性与形态复杂性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。