Skip to main content
QUICK REVIEW

[论文解读] mT5: A massively multilingual pre-trained text-to-text transformer

Linting Xue, Noah Constant|arXiv (Cornell University)|Oct 22, 2020
Topic Modeling参考文献 49被引用 601
一句话总结

mT5 在 T5 基础上扩展到 101 种语言,使用多语言预训练数据集(mC4),在多语言基准上显示出最先进的结果,解决零-shot 生成中的意外翻译问题,采用领域保持的微调技术。

ABSTRACT

The recent "Text-to-Text Transfer Transformer" (T5) leveraged a unified text-to-text format and scale to attain state-of-the-art results on a wide variety of English-language NLP tasks. In this paper, we introduce mT5, a multilingual variant of T5 that was pre-trained on a new Common Crawl-based dataset covering 101 languages. We detail the design and modified training of mT5 and demonstrate its state-of-the-art performance on many multilingual benchmarks. We also describe a simple technique to prevent "accidental translation" in the zero-shot setting, where a generative model chooses to (partially) translate its prediction into the wrong language. All of the code and model checkpoints used in this work are publicly available.

研究动机与目标

  • 开发一个与原始配方偏差极小的极大多语言版本的 T5。
  • 创建一个涵盖 101 种语言的多语言预训练数据集(mC4),数据来自 Common Crawl。
  • 在 xtreme 的多语言基准测试中评估 mT5 在分类、问答和命名实体识别任务上的表现。
  • 通过领域保持微调来研究并缓解零-shot 生成中的意外翻译问题。
  • 向社区提供开源代码和预训练检查点。

提出的方法

  • 扩展 T5.1.1 配方(GeGLU 激活、增大的 d_model 和 d_ff、预训练阶段不使用 dropout)。
  • 通过语言检测并筛选 Common Crawl 数据来构建 mC4,使其包含 101 种语言,置信度阈值为 70%,每种语言 10,000 页以上。
  • 在预训练阶段对多语言数据进行采样,p(L) ∝ |L|^α 以提升低资源语言(α 调整为 0.3)。
  • 使用 250k SentencePiece 词汇表,具备语言特定覆盖和对大型脚本的字节回退。
  • 通过将所有任务转换为文本到文本格式来微调和评估 xtreme 任务;探索 zero-shot、translate-train 和 in-language multitask 设置。
  • 通过领域自适应预训练(在微调时混入 mC4)并降低语言采样偏差(将 α 降低到 0.1)来解决零-shot 的意外翻译问题。

实验结果

研究问题

  • RQ1一个以 T5 风格为基础、在广泛多语言语料上训练的模型,能否在许多语言上取得最先进的结果?
  • RQ2模型容量如何影响跨语言迁移以及对翻译数据或就地语言数据的需求?
  • RQ3零-shot 生成中导致意外翻译的机制是什么,是否可将多语言预训练数据混入微调以缓解?
  • RQ4预训练过程中的语言采样如何影响高资源语言与低资源语言的性能?

主要发现

  • mT5-XXL 在分类和问答基准上达到最先进的结果,并且在命名实体识别(NER)上逼近 SOTA。
  • 在 xtreme 任务中,使用 translate-train 的 mT5 超越先前模型;零-shot 的性能随着模型规模增大而接近 translate-train。
  • 更大的 mT5 模型在 SQuAD 上缩小了与英语仅 T5 的差距,表明容量提升可以缓解跨语言干扰。
  • 在微调中混入少量多语言预训练数据显著降低较小模型在零-shot XQuAD 中的非法/意外翻译预测。
  • 在数据收集阶段进行行长度过滤显著提高 XNLI 的准确率(消融中提升 +2 点)。
  • 将 α 提高以提升高资源语言对某些语言有帮助,但对许多低资源语言造成损害;将 α 降至接近均匀会降低这种偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。