Skip to main content
QUICK REVIEW

[论文解读] A Survey of Multi-task Learning in Natural Language Processing: Regarding Task Relatedness and Training Methods

Zhihan Zhang, Wenhao Yu|arXiv (Cornell University)|Apr 7, 2022
Topic Modeling被引用 5
一句话总结

本综述根据任务相关性,将自然语言处理(NLP)中的多任务学习(MTL)分为两种训练范式——联合训练和多步训练。它分析了任务依赖关系如何决定方法选择,回顾了NLP各领域中的应用,并指出了未来方向,如利用元学习实现自适应MTL,以及在迁移学习流程中优化MTL。

ABSTRACT

Multi-task learning (MTL) has become increasingly popular in natural language processing (NLP) because it improves the performance of related tasks by exploiting their commonalities and differences. Nevertheless, it is still not understood very well how multi-task learning can be implemented based on the relatedness of training tasks. In this survey, we review recent advances of multi-task learning methods in NLP, with the aim of summarizing them into two general multi-task training methods based on their task relatedness: (i) joint training and (ii) multi-step training. We present examples in various NLP downstream applications, summarize the task relationships and discuss future directions of this promising topic.

研究动机与目标

  • 为解决在NLP中基于任务相关性选择MTL训练方法时缺乏明确指导的问题。
  • 将近期NLP中的MTL方法归类为两种通用训练框架:联合训练与多步训练。
  • 分析多样化NLP应用中任务关系与训练依赖,以指导方法选择。
  • 识别MTL中的开放挑战与未来研究方向,尤其关注元学习与迁移学习的整合。
  • 为研究人员提供一个结构化框架,以便在选择特定架构或损失函数之前,选择合适的MTL方法。

提出的方法

  • 将NLP中的MTL方法分为两种训练范式:联合训练(通过共享表示同时训练多个任务)与多步训练(通过依赖链按顺序训练任务)。
  • 使用编码器-解码器架构作为统一框架来建模多任务学习,其中包含共享编码器和任务特定解码器。
  • 将任务相关性作为选择联合训练或多步训练的关键决定因素,基于输入/输出依赖关系进行判断。
  • 回顾代表性模型,如Deep Relationship Network、Cross-stitch和Sluice Network用于联合训练,以及Prediction Distillation和Cascaded Information用于多步训练。
  • 将先前综述(Ruder, 2017;Crawshaw, 2020)中的现有MTL框架映射到所提出的联合训练与多步训练类别中。
  • 提出任务依赖结构——即任务是否可并行训练或需顺序处理——决定了训练方法的选择。

实验结果

研究问题

  • RQ1如何利用任务相关性来判断在NLP多任务学习中应采用联合训练还是多步训练?
  • RQ2在NLP应用中,联合训练与多步训练在架构与训练方面有何差异?
  • RQ3先前综述(如Ruder, 2017;Crawshaw, 2020)中的现有MTL框架如何映射到所提出的联合训练与多步训练类别中?
  • RQ4在通用模型与迁移学习流程中应用MTL时面临的关键挑战是什么?
  • RQ5元学习如何通过实现快速适应与自适应参数共享来增强多任务学习?

主要发现

  • 当任务可并行训练且共享共同表示时,联合训练是合适的,例如在多意图分类或多语言NLP中。
  • 当一个任务的输出是另一个任务的前提时,必须采用多步训练,例如在级联信息抽取或基于蒸馏的训练中。
  • 任务相关性——特别是结构与功能依赖——决定了训练方法的选择,联合训练适用于可并行化的任务,而多步训练则处理顺序依赖关系。
  • 现有MTL框架如Cross-stitch与Sluice Network最适合归类为联合训练,而Prediction Distillation与Cascaded Information则属于多步训练。
  • 元学习在实现自适应参数共享与快速适应方面展现出潜力,尤其在少样本或零样本迁移场景中。
  • MTL在迁移学习中的作用仍研究不足,近期工作更倾向于采用多任务预训练而非微调,以实现更好的领域泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。