Skip to main content
QUICK REVIEW

[论文解读] ExT5: Towards Extreme Multi-Task Scaling for Transfer Learning

Vamsi Aribandi, Yi Tay|arXiv (Cornell University)|Nov 22, 2021
Topic Modeling参考文献 126被引用 8
一句话总结

该论文提出了ExT5,一种在107种多样化NLP任务(ExMix)的海量混合数据上进行预训练,并结合C4上的自监督掩码去噪训练的模型,其在SuperGLUE、GEM、Rainbow和闭卷问答基准测试中达到了最先进性能。ExT5表明,极端多任务扩展显著提升了零样本和微调迁移学习效果,降低了样本复杂度,并优于精心挑选的任务混合组合及强大的T5基线模型。

ABSTRACT

Despite the recent success of multi-task learning and transfer learning for natural language processing (NLP), few works have systematically studied the effect of scaling up the number of tasks during pre-training. Towards this goal, this paper introduces ExMix (Extreme Mixture): a massive collection of 107 supervised NLP tasks across diverse domains and task-families. Using ExMix, we study the effect of multi-task pre-training at the largest scale to date, and analyze co-training transfer amongst common families of tasks. Through this analysis, we show that manually curating an ideal set of tasks for multi-task pre-training is not straightforward, and that multi-task scaling can vastly improve models on its own. Finally, we propose ExT5: a model pre-trained using a multi-task objective of self-supervised span denoising and supervised ExMix. Via extensive experiments, we show that ExT5 outperforms strong T5 baselines on SuperGLUE, GEM, Rainbow, Closed-Book QA tasks, and several tasks outside of ExMix. ExT5 also significantly improves sample efficiency while pre-training.

研究动机与目标

  • 研究在多任务预训练中增加任务数量对迁移学习效果的影响。
  • 评估大规模、多样化任务混合是否能优于精心挑选的任务组合。
  • 开发一种可扩展的统一框架,用于编码器-解码器模型同时训练广泛范围的NLP任务。
  • 评估极端多任务扩展对下游迁移性能和样本效率的影响。
  • 证明大规模多任务预训练可在无需任务特定调优或大量超参数调优的情况下实现优异性能。

提出的方法

  • 提出ExMix,一个包含107种多样化英语NLP任务的集合,所有任务均以文本到文本的配对形式呈现,用于统一的多任务训练。
  • 使用单一目标函数,在C4上进行自监督掩码去噪与ExMix上的监督学习相结合的方式,对ExT5进行预训练。
  • 对ExMix中的每个任务采用比例采样,以平衡数据分布,防止对高资源任务的过拟合。
  • 采用标准T5架构,所有任务共享参数,实现参数高效的多任务学习。
  • 使用标准训练协议,包括批量大小、初始学习率和早停策略,并在标准基准上进行评估。
  • 在多个下游任务和预训练步数下,将ExT5与原始T5及其他基线模型进行比较。

实验结果

研究问题

  • RQ1与较小规模、精心挑选的任务集相比,增加多任务预训练中的任务数量是否能提升下游性能?
  • RQ2大规模、多样化任务混合是否在迁移学习效果上优于人工精心组合的任务集?
  • RQ3极端多任务扩展是否能减少达到强性能所需的预训练步数?
  • RQ4在ExMix上进行多任务预训练如何影响模型的泛化能力和样本效率?
  • RQ5在大规模多任务设置中,跨不同任务族的联合训练迁移会产生何种影响?

主要发现

  • ExT5在SuperGLUE上的平均得分为79.9,显著优于原始T5基线模型(76.1)和人工优化的混合任务设置(76.4)。
  • ExT5在仅200k个预训练步数后即达到79.9的SuperGLUE平均分,优于T5.1.1在200k步时的得分(83.8),并在200k步时达到85.3,表明其具有更高的样本效率。
  • ExT5在WiC基准上的平均得分为93.3,而原始T5基线模型仅为81.7。
  • 在完整ExMix混合数据(107项任务)上训练的模型在SuperGLUE上取得79.9的平均分,而随机选取的55项任务子集仅取得77.0的平均分,表明更大的任务混合组合更具有效性。
  • ExT5在GEM、Rainbow和闭卷问答任务上优于强大的T5基线模型,证明其泛化能力广泛超越ExMix任务本身。
  • 研究表明,手动构建最优任务组合并非易事,而大规模多任务预训练即使未进行显式调优,也能实现净正向迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。