Skip to main content
QUICK REVIEW

[论文解读] How Robust is Neural Machine Translation to Language Imbalance in Multilingual Tokenizer Training?

Shiyue Zhang, Vishrav Chaudhary|arXiv (Cornell University)|Apr 29, 2022
Natural Language Processing Techniques被引用 6
一句话总结

本文研究了多语言分词器训练期间语言不平衡对神经机器翻译(NMT)鲁棒性的影响。研究发现,NMT性能对不平衡的容忍度高于预期,尤其是在语言共享书写系统时——并提出了两个早期预警指标:未知词符(UNK)率和接近字符级别的程度。研究建议在分词器训练中平衡语言数据,并使用这些指标在下游使用前评估预训练分词器的质量。

ABSTRACT

A multilingual tokenizer is a fundamental component of multilingual neural machine translation. It is trained from a multilingual corpus. Since a skewed data distribution is considered to be harmful, a sampling strategy is usually used to balance languages in the corpus. However, few works have systematically answered how language imbalance in tokenizer training affects downstream performance. In this work, we analyze how translation performance changes as the data ratios among languages vary in the tokenizer training corpus. We find that while relatively better performance is often observed when languages are more equally sampled, the downstream performance is more robust to language imbalance than we usually expected. Two features, UNK rate and closeness to the character level, can warn of poor downstream performance before performing the task. We also distinguish language sampling for tokenizer training from sampling for model training and show that the model is more sensitive to the latter.

研究动机与目标

  • 系统评估多语言分词器训练中的语言不平衡对下游NMT性能的影响。
  • 确定分词器训练与模型训练的语言采样策略对翻译质量的影响是否不同。
  • 识别可预测下游性能不佳的早期中间指标(如UNK率、接近字符级别程度),而无需运行完整训练。
  • 为多语言分词器的训练与评估提供实用建议,以避免低资源语言的性能不足。

提出的方法

  • 作者在分词器训练语料中改变八种语言(英语、他加禄语、冰岛语、丹麦语、印度尼西亚语、泰米尔语、希腊语、中文)之间的数据比例,同时保持模型训练的采样策略不变。
  • 使用基于温度的采样方法控制分词器训练数据中的语言比例,指数因子S = 0, 0.3, 和 1.0。
  • 通过双语和多语言设置下的spBLEU分数评估翻译性能,使用多个随机种子和消融实验。
  • 计算两个中间特征:UNK率(每句话中未知词符的平均百分比)和接近字符级别程度(平均子词长度除以字符长度)。
  • 通过隔离每个因素并保持另一个因素恒定,比较语言不平衡在分词器训练与模型训练中的影响。
  • 实验在多样化多语言数据集上进行,双语设置中进行了1,890次实验,多语言设置中进行了31次实验,最多使用64块GPU。

实验结果

研究问题

  • RQ1多语言分词器训练中的语言不平衡如何影响下游NMT翻译性能?
  • RQ2UNK率和接近字符级别程度能否作为下游性能不佳的可靠早期指标?
  • RQ3NMT对语言不平衡在模型训练中还是分词器训练中更敏感?
  • RQ4分词器训练的最优语言采样策略是什么?它是否与模型训练不同?
  • RQ5能否为UNK率和接近字符级别程度建立实用阈值,以指示可接受的分词器质量?

主要发现

  • NMT性能对分词器训练中的语言不平衡具有比以往预期更强的鲁棒性,仅在极端比例(如1:100,000)且语言共享书写系统时才会出现显著性能下降。
  • 当分词器训练数据中语言更均衡时,翻译性能始终更优,平衡程度与性能之间存在中等程度的皮尔逊相关性(r ≈ 0.5–0.7)。
  • 由于英语在其他语言的单语数据中频繁共现,其对不平衡具有极强的抗性,几乎不会被“饿死”。
  • 两个中间特征——UNK率和接近字符级别程度——可作为下游性能的强预测指标,阈值约为3.7%的UNK率和约0.87的接近字符级别程度,可指示可接受的质量。
  • NMT对模型训练中的语言不平衡比对分词器训练更敏感,表明模型层面的采样策略需要更多关注。
  • 本研究建议在分词器训练中使用均衡的语言比例,并在部署前利用所提出的两个特征验证预训练分词器的质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。