[论文解读] MVP: Multi-task Supervised Pre-training for Natural Language Generation
本文提出MVP(多任务监督预训练),一种用于自然语言生成(NLG)的方法,该方法在涵盖11项NLG任务的77个数据集的大型统一文本到文本语料库上对序列到序列模型进行预训练。通过利用任务特定的软提示进行监督预训练,MVP在17个基准数据集中的13个上实现了最先进性能,相较于BART提升9.3%,相较于Flan-T5提升5.8%。
Pre-trained language models (PLMs) have achieved remarkable success in natural language generation (NLG) tasks. Up to now, most NLG-oriented PLMs are pre-trained in an unsupervised manner using the large-scale general corpus. In the meanwhile, an increasing number of models pre-trained with labeled data (i.e. "supervised pre-training") showcase superior performance compared to unsupervised pre-trained models. Motivated by the success of supervised pre-training, we propose Multi-task superVised Pre-training (MVP) for natural language generation. We collect a large-scale natural language generation corpus, MVPCorpus, from $77$ datasets over $11$ diverse NLG tasks. Then we unify these examples into a general text-to-text format to pre-train the text generation model MVP in a supervised manner. For each task, we further pre-train specific soft prompts to stimulate the model's capacity to perform a specific task. Our MVP model can be seen as a practice that utilizes recent instruction tuning on relatively small PLMs. Extensive experiments have demonstrated the effectiveness and generality of our MVP model in a number of NLG tasks, which achieves state-of-the-art performance on $13$ out of $17$ datasets, outperforming BART by $9.3\%$ and Flan-T5 by $5.8\%$.
研究动机与目标
- 为解决无监督预训练在NLG中的局限性,其可能引入噪声并减缓知识获取速度。
- 探究是否通过在训练早期使用标注数据进行监督预训练,能够更好地将预训练模型与下游NLG任务对齐。
- 构建一个通用的NLG模型,通过多任务学习在多种文本生成任务中实现有效泛化。
- 探究任务特定软提示在增强模型对特定NLG任务能力方面的有效性。
- 创建并发布MVPCorpus,这是目前已知最大的标注NLG数据集集合,以支持未来在监督预训练方面的研究。
提出的方法
- 通过收集并统一来自11项不同NLG任务的77个数据集,将其转换为标准化的文本到文本格式,并附带任务特定指令,构建MVPCorpus。
- 使用监督学习在MVPCorpus上预训练一个基于Transformer的序列到序列模型,使模型在预训练阶段即可直接学习任务特定模式。
- 通过类似前缀调优(prefix-tuning)的机制引入任务特定软提示,使模型能够动态适应不同任务,而无需进行完整的微调。
- 使用多任务学习联合优化全部11项NLG任务,提升泛化能力并减少任务间的干扰。
- 应用参数高效微调(如前缀调优)来评估模型在下游任务中的零样本和少样本能力。
- 通过自然语言指令标准化所有任务的输入输出格式,确保预训练过程中的一致性和兼容性。
实验结果
研究问题
- RQ1与无监督预训练相比,在大规模多任务NLG语料库上进行监督预训练是否能提升模型性能?
- RQ2通过多样化NLG任务进行多任务学习是否能增强预训练模型的泛化能力?
- RQ3任务特定软提示是否能有效捕捉并存储针对单个NLG任务的专用知识?
- RQ4在全量微调和参数高效微调设置下,MVP与Flan-T5和BART等最先进模型相比表现如何?
- RQ5监督预训练在多大程度上减少了NLG中预训练与微调之间的领域差距?
主要发现
- MVP在17个基准数据集中的13个上实现了最先进性能,证明其在多样化NLG任务中具有强大的泛化能力。
- 在全量微调设置下,MVP在17个数据集上的平均性能相比BART提升了9.3%。
- 在参数高效微调(如前缀调优)设置下,MVP仍比BART高出4.3%,表明其具备出色的低样本适应能力。
- MVP在平均性能上比Flan-T5高出5.8%,证实其优于强大的指令微调基线模型。
- MVP的零样本性能显著优于T0-11B,凸显了监督预训练的有效性。
- 任务特定软提示的集成(MVP+S)进一步提升了特定任务上的性能,证实了基于提示的适应策略的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。