Skip to main content
QUICK REVIEW

[论文解读] Bilex Rx: Lexical Data Augmentation for Massively Multilingual Machine Translation

Alex K. Jones, Isaac Caswell|arXiv (Cornell University)|Mar 27, 2023
Natural Language Processing Techniques被引用 5
一句话总结

本文提出 Bilex Rx,一种词汇数据增强方法,通过在训练中整合高质量双语词典,显著提升大规模多语言神经机器翻译(NMT)性能。通过使用筛选后的词级翻译对单语及并行单语数据进行增强,该方法在低资源和零样本语言上取得显著性能提升,表明即使规模较小、经过精心筛选的词典,其效果也优于更大但噪声较多的词典,且性能增益可随模型规模扩展,并可与其他增强技术结合。

ABSTRACT

Neural machine translation (NMT) has progressed rapidly over the past several years, and modern models are able to achieve relatively high quality using only monolingual text data, an approach dubbed Unsupervised Machine Translation (UNMT). However, these models still struggle in a variety of ways, including aspects of translation that for a human are the easiest - for instance, correctly translating common nouns. This work explores a cheap and abundant resource to combat this problem: bilingual lexica. We test the efficacy of bilingual lexica in a real-world set-up, on 200-language translation models trained on web-crawled text. We present several findings: (1) using lexical data augmentation, we demonstrate sizable performance gains for unsupervised translation; (2) we compare several families of data augmentation, demonstrating that they yield similar improvements, and can be combined for even greater improvements; (3) we demonstrate the importance of carefully curated lexica over larger, noisier ones, especially with larger models; and (4) we compare the efficacy of multilingual lexicon data versus human-translated parallel data. Finally, we open-source GATITOS (available at https://github.com/google-research/url-nlp/tree/main/gatitos), a new multilingual lexicon for 26 low-resource languages, which had the highest performance among lexica in our experiments.

研究动机与目标

  • 探究在大规模多语言设置下,使用双语词典进行词汇数据增强是否能改善无监督和低资源机器翻译。
  • 在真实世界、网络爬取的大规模多语言训练环境中,比较基于多语言词典的各种数据增强策略的有效性。
  • 评估词典质量与数量的影响,尤其是在模型规模扩大时的表现。
  • 在低资源翻译场景中,将多语言词典数据与人工翻译的并行数据进行基准对比。
  • 发布一个新的高质量多语言词典 GATITOS,涵盖 26 种低资源语言,以支持未来研究。

提出的方法

  • 使用多语言词典中的词级翻译对单语和并行训练数据进行增强,涵盖如 Panlex 等大规模但噪声较多的来源,以及更小但经过筛选的来源。
  • 应用多种数据增强变体:直接注入词典、使用词典生成的并行对进行反向翻译,以及结合多种策略的混合方法。
  • 在网页爬取的单语和并行语料上训练 200 种语言的 NMT 模型,采用共享编码器、共享解码器架构,对比是否使用词汇增强。
  • 使用跨语言句子编码器从单语数据中挖掘双语语料,并将这些语料与词汇增强后的数据联合训练。
  • 使用 FLORES-200 基准的 CHRF++ 指标评估性能,比较高资源、低资源和零样本语言对的模型表现。
  • 开源 GATITOS,一个为 26 种低资源语言精心筛选的多语言词典,其翻译质量通过专家和模型过滤方法验证。

实验结果

研究问题

  • RQ1使用双语词典进行词汇数据增强是否能在无监督和低资源机器翻译中带来可测量的性能提升?
  • RQ2基于词典的不同数据增强策略在性能增益和可扩展性方面如何比较?
  • RQ3在模型规模增大时,词典质量是否比其规模更重要?
  • RQ4词汇增强能否与其它数据增强技术(如反向翻译或双语语料挖掘)有效结合?
  • RQ5在低资源语言翻译中,多语言词典数据与人工翻译的并行数据相比,效果如何?

主要发现

  • 使用双语词典进行词汇数据增强在所有语言类型中均带来显著且一致的性能提升,其中低资源和零样本设置下的提升最为明显。
  • 更小但经过精心筛选的词典在模型规模增大时表现优于更大但噪声较多的词典,表明数据质量比数据量更为关键。
  • 多种增强策略——直接注入、反向翻译和混合方法——带来的增益相似,且可组合使用以实现更显著的性能提升。
  • 所提出的 GATITOS 词典在 26 种低资源语言上的实验中,表现优于所有其他测试词典。
  • 词汇增强带来的性能增益具有可扩展性和泛化能力,在高资源、低资源和零样本语言对中均保持一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。