Skip to main content
QUICK REVIEW

[论文解读] Language-Family Adapters for Low-Resource Multilingual Neural Machine Translation

Alexandra Chronopoulou, Dario Stojanovski|arXiv (Cornell University)|Sep 30, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文提出语言族适配器以解决低资源多语言神经机器翻译问题,在保持 mBART-50 主干网络冻结的前提下,针对语言上相关的语言组(如斯拉夫-波罗地亚语、印度-伊朗语)训练轻量级适配器。该方法在 16 个低资源语言对上相比语言对适配器提升 +1.0 BLEU,相比语言无关适配器提升 +2.7 BLEU,参数量不足 20%,并通过利用跨语言相似性显著提升了对未见语言的零样本迁移能力。

ABSTRACT

Large multilingual models trained with self-supervision achieve state-of-the-art results in a wide range of natural language processing tasks. Self-supervised pretrained models are often fine-tuned on parallel data from one or multiple language pairs for machine translation. Multilingual fine-tuning improves performance on low-resource languages but requires modifying the entire model and can be prohibitively expensive. Training a new adapter on each language pair or training a single adapter on all language pairs without updating the pretrained model has been proposed as a parameter-efficient alternative. However, the former does not permit any sharing between languages, while the latter shares parameters for all languages and is susceptible to negative interference. In this paper, we propose training language-family adapters on top of mBART-50 to facilitate cross-lingual transfer. Our approach outperforms related baselines, yielding higher translation scores on average when translating from English to 17 different low-resource languages. We also show that language-family adapters provide an effective method to translate to languages unseen during pretraining.

研究动机与目标

  • 通过在现有适配器方法基础上改进参数高效微调,应对低资源多语言神经机器翻译(NMT)的挑战。
  • 通过基于语言相似性的语言分组而非为所有语言训练单一共享适配器,减少参数高效微调中的负面干扰。
  • 通过利用语言族内部共享的跨语言表征,实现对预训练阶段未见语言的有效零样本翻译。
  • 评估基于语言知识的分组是否优于基于表征的聚类方法(如高斯混合模型,GMM)在多语言 NMT 中适配器训练的表现。
  • 评估在 Transformer 架构中插入嵌入层适配器以编码词汇级信息的影响。

提出的方法

  • 在冻结的 mBART-50 模型之上训练语言族适配器,每个适配器在特定语言族(如印度-伊朗语、阿尔泽尼安语)的并行单语数据上进行训练。
  • 利用语言知识库(如 Glottolog)对语言进行分组,基于共享的语法和语音特征形成语言族,而非依赖模型学习到的表征。
  • 在 Transformer 的编码器和解码器层中插入适配器模块,每个语言族配备独立的适配器,以实现参数高效的微调。
  • 采用两阶段训练流程:第一阶段在各自语言族的并行数据上训练语言族适配器;第二阶段在已见和未见语言上进行评估。
  • 在多语言句子表征上使用高斯混合模型(GMM)对语言进行聚类,用于与基于语言知识的分组进行对比。
  • 通过消融实验评估嵌入层适配器的贡献以及不同聚类策略对翻译性能的影响。

实验结果

研究问题

  • RQ1与语言对适配器或语言无关适配器相比,基于语言族分组的适配器是否能提升低资源语言的翻译性能?
  • RQ2语言族适配器是否能有效将知识迁移至 mBART-50 预训练阶段未见的语言?
  • RQ3在翻译质量与鲁棒性方面,基于语言知识的分组与基于表征的聚类(如 GMM)相比表现如何?
  • RQ4插入嵌入层适配器以编码词汇级信息对模型有何贡献?
  • RQ5与为所有语言共享单一适配器相比,所提出方法在多大程度上减少了负面干扰?

主要发现

  • 在 OPUS-100 的 16 个低资源语言对上,语言族适配器相比语言对适配器提升 +1.0 BLEU,相比语言无关适配器提升 +2.7 BLEU。
  • 该方法在所有语言族中均优于两个基线模型,尤其在马来-波利尼西亚语族和印度-伊朗语族中提升超过 +2.0 BLEU。
  • 对于未包含在 mBART-50 预训练数据中的未见语言,语言族适配器显著优于两个基线模型,证明了其有效的零样本迁移能力。
  • 语言无关适配器基线表现劣于语言族适配器和语言对适配器,尤其在未见语言上,这是由于来自无关语言簇的负面干扰所致。
  • 消融实验证实插入嵌入层适配器可提升性能,表明词汇级信息对低资源翻译有益。
  • 基于语言知识的分组在多语言句子表征上始终优于 GMM 聚类,证实了在适配器设计中引入领域特定语言结构的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。