Skip to main content
QUICK REVIEW

[论文解读] UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining

Hyung Won Chung, Noah Constant|arXiv (Cornell University)|Apr 18, 2023
Natural Language Processing Techniques被引用 6
一句话总结

UniMax 是一种用于多语言预训练的新型语言采样策略,通过限制每种语言的最大重复次数,确保训练 token 在不同语言间分布更均衡,从而在减少低资源语言过拟合的同时,保持对高资源语言的均匀覆盖。该方法在多种模型规模和基准测试中均优于标准的温度采样策略,展现出更好的泛化能力并降低了记忆化风险。

ABSTRACT

Pretrained multilingual large language models have typically used heuristic temperature-based sampling to balance between different languages. However previous work has not systematically evaluated the efficacy of different pretraining language distributions across model scales. In this paper, we propose a new sampling method, UniMax, that delivers more uniform coverage of head languages while mitigating overfitting on tail languages by explicitly capping the number of repeats over each language's corpus. We perform an extensive series of ablations testing a range of sampling strategies on a suite of multilingual benchmarks, while varying model scale. We find that UniMax outperforms standard temperature-based sampling, and the benefits persist as scale increases. As part of our contribution, we release: (i) an improved and refreshed mC4 multilingual corpus consisting of 29 trillion characters across 107 languages, and (ii) a suite of pretrained umT5 model checkpoints trained with UniMax sampling.

研究动机与目标

  • 解决因低资源语言数据极度稀缺而导致的多语言预训练不平衡问题。
  • 缓解标准温度采样中因过度重复低资源语言数据而引发的过拟合与记忆化风险。
  • 开发一种可扩展、计算高效的采样策略,在不重新优先处理高资源语言的前提下,维持均匀的语言覆盖。
  • 评估不同采样策略在不同模型规模和多语言基准上的影响。
  • 发布一个改进后的 mC4 语料库以及使用 UniMax 训练的 umT5 预训练模型,以供更广泛的研究使用。

提出的方法

  • UniMax 基于最大重复限制(N)预先为低资源语言分配训练 token,确保任何语言的训练周期不超过 N 次。
  • 对于剩余的训练预算,它在所有具备足够数据的语言间均匀分配 token,优先考虑语言实用性并最小化分布偏差。
  • 该方法显式控制每种语言的数据重复次数,直接对抗大模型中的过拟合与记忆化问题。
  • 它使用固定计算预算(例如,1024 序列长度下 1M 步)作为约束,转化为固定的 token 预算用于训练。
  • 该方法对模型缩放具有鲁棒性,在模型规模增大时仍能保持均衡的语言覆盖。
  • 它通过用重复次数的硬性上限替代启发式温度超参数,避免对温度超参数的依赖。

实验结果

研究问题

  • RQ1限制每种语言的重复次数是否能提升多语言基准上的下游性能?
  • RQ2在不同模型规模下,UniMax 与温度采样相比,在泛化能力和过拟合方面表现如何?
  • RQ3在语言间实现训练 token 的均匀分布,是否能同时提升高资源语言和低资源语言的性能?
  • RQ4UniMax 在多大程度上减少了因重复低资源语言样本而引发的记忆化风险?
  • RQ5当将该方法应用于更新的、更大的多语言语料库(如 mC4)时,其表现如何?

主要发现

  • UniMax 在多语言基准上优于标准温度采样(τ=3.33),且性能提升在不同模型规模下均持续存在。
  • 该方法显著减少了低资源语言的过度重复——例如,约鲁巴语在 UniMax 下仅重复 100 次,而 τ=3.33 下超过 100 次。
  • 在 1× 训练预算下,UniMax 即使在原始数据规模相差 70 倍的情况下,仍为英语和中文分配相等的训练 token,有效防止了对低资源语言的过拟合。
  • 论文发布的改进版 mC4 语料库包含 107 种语言的 29 万亿个字符,体现了更新且更均衡的多语言数据集。
  • 使用 UniMax 采样训练的 umT5 预训练模型检查点在多语言评估任务中表现出一致的性能提升,尤其在低资源语言上更为显著。
  • 该方法对模型缩放具有鲁棒性:随着模型规模增大,UniMax 的优势依然保持,归因于其对数据重复的显式控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。