Skip to main content
QUICK REVIEW

[论文解读] English Intermediate-Task Training Improves Zero-Shot Cross-Lingual Transfer Too

Jason Phang, Iacer Calixto|arXiv (Cornell University)|May 26, 2020
Topic Modeling被引用 10
一句话总结

该论文表明,在英语语言理解任务上进行中间任务微调,可显著提升在 XTREME 基准测试中的零样本跨语言迁移性能。通过在目标任务微调前,先在高资源英语任务(如 MNLI、SQuAD 和 HellaSwag)上微调 XLM-R 模型,该方法在 XLM-R Large 基础上实现了平均 5.4 分的性能提升,成为截至 2020 年 6 月的新 SOTA(最先进)结果。

ABSTRACT

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuning again on the target task---often improves model performance substantially on language understanding tasks in monolingual English settings. We investigate whether English intermediate-task training is still helpful on non-English target tasks. Using nine intermediate language-understanding tasks, we evaluate intermediate-task transfer in a zero-shot cross-lingual setting on the XTREME benchmark. We see large improvements from intermediate training on the BUCC and Tatoeba sentence retrieval tasks and moderate improvements on question-answering target tasks. MNLI, SQuAD and HellaSwag achieve the best overall results as intermediate tasks, while multi-task intermediate offers small additional improvements. Using our best intermediate-task models for each target task, we obtain a 5.4 point improvement over XLM-R Large on the XTREME benchmark, setting the state of the art as of June 2020. We also investigate continuing multilingual MLM during intermediate-task training and using machine-translated intermediate-task data, but neither consistently outperforms simply performing English intermediate-task training.

研究动机与目标

  • 探究在英语数据上进行中间任务微调是否能提升多语言模型在零样本跨语言迁移中的表现。
  • 评估在单语英语设置中获得的中间微调优势是否可扩展至多语言、零样本跨语言迁移场景。
  • 评估其他策略(如在中间训练中继续多语言掩码语言建模,或使用机器翻译的中间数据)是否优于简单的英语中间任务微调。
  • 识别在 XTREME 基准测试中,哪些中间任务在多样化的目标任务上能带来最强的性能提升。

提出的方法

  • 在最终目标任务微调前,先在一个或多个英语中间任务上微调预训练的多语言 XLM-R 模型。
  • 使用 XTREME 基准测试中的九个中间任务:ANLI+、MNLI、QQP、SQuAD v1.1/v2.0、HellaSwag、CCG、Cosmos QA 和 CSQA。
  • 在 XTREME 基准测试的九个目标任务上,评估 40 种语言的零样本跨语言性能。
  • 将单任务中间微调与在全部九个任务上进行多任务中间微调进行比较。
  • 研究两种变体:(1) 在中间训练期间继续多语言掩码语言建模;(2) 在德语、俄语和斯瓦希里语中使用机器翻译的中间数据。
  • 报告开发集和测试集上的结果,重点关注跨语言和任务的平均性能提升。

实验结果

研究问题

  • RQ1在英语任务上进行中间任务微调是否能提升多语言基准测试中的零样本跨语言迁移性能?
  • RQ2哪些具体的英语中间任务在跨语言迁移性能上带来了最大提升?
  • RQ3在中间训练期间继续多语言掩码语言建模是否相比标准的仅英语中间训练能带来性能提升?
  • RQ4在其他语言中使用机器翻译的中间数据是否相比仅在英语数据上训练能带来更好的跨语言迁移性能?
  • RQ5多任务中间训练与单任务中间训练相比,在零样本泛化能力上表现如何?

主要发现

  • 在 ANLI+、MNLI、QQP、SQuAD v1.1/v2.0、HellaSwag、CCG、Cosmos QA 和 CSQA 九个中间任务上,MNLI、SQuAD v2.0 和 HellaSwag 分别带来了 7.5、8.2 和 7.0 分的最大提升(开发集)。
  • 在全部九个任务上进行多任务中间微调,在开发集上实现了最高的 8.7 分提升。
  • 该方法在完整的 XTREME 基准测试中,相比 XLM-R Large 实现了 5.4 分的平均性能提升,成为截至 2020 年 6 月的新 SOTA。
  • 英语中间任务微调优于在中间训练期间继续多语言掩码语言建模,也优于使用机器翻译的中间数据。
  • 在 BUCC 和 Tatoeba(句子检索)任务上观察到显著提升,部分情况下提升超过 30 分。
  • TyDiQA 在使用多个中间任务时表现出一致的性能提升,而 XNLI 任务未从中间训练中受益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。