Skip to main content
QUICK REVIEW

[论文解读] Should We Be Pre-training? An Argument for End-task Aware Training as an Alternative

Lucio M. Dery, Paul Michel|arXiv (Cornell University)|Sep 15, 2021
Explainable Artificial Intelligence (XAI)被引用 9
一句话总结

本文提出以多任务学习(MT-TARTAN)和元学习(META-TARTAN)实现端到端任务感知的训练,替代传统的端到端任务无关持续预训练,显著提升了低资源自然语言处理任务的下游性能与数据效率。该方法联合优化辅助目标与最终任务,性能优于标准预训练方法,且无需大量超参数调优。

ABSTRACT

In most settings of practical concern, machine learning practitioners know in advance what end-task they wish to boost with auxiliary tasks. However, widely used methods for leveraging auxiliary data like pre-training and its continued-pretraining variant are end-task agnostic: they rarely, if ever, exploit knowledge of the target task. We study replacing end-task agnostic continued training of pre-trained language models with end-task aware training of said models. We argue that for sufficiently important end-tasks, the benefits of leveraging auxiliary data in a task-aware fashion can justify forgoing the traditional approach of obtaining generic, end-task agnostic representations as with (continued) pre-training. On three different low-resource NLP tasks from two domains, we demonstrate that multi-tasking the end-task and auxiliary objectives results in significantly better downstream task performance than the widely-used task-agnostic continued pre-training paradigm of Gururangan et al. (2020). We next introduce an online meta-learning algorithm that learns a set of multi-task weights to better balance among our multiple auxiliary objectives, achieving further improvements on end-task performance and data efficiency.

研究动机与目标

  • 挑战在已知目标任务的低资源自然语言处理设置中,传统端到端任务无关预训练的既定观念。
  • 通过将最终任务目标直接整合到训练过程中,解决标准持续预训练方法效率低下与超参数敏感的问题。
  • 通过平衡辅助任务与最终任务目标的多任务学习,提升数据效率与下游性能。
  • 开发基于元学习的方法,自适应地加权多个目标,进一步提升最终任务性能。
  • 减少对启发式预训练调度的依赖,并消除对大量基于验证的超参数调优的需求。

提出的方法

  • 提出MT-TARTAN,一种多任务学习框架,在预训练过程中联合优化掩码语言建模目标与最终任务目标。
  • 提出META-TARTAN,一种在线元学习算法,通过最小化最终任务验证损失来学习动态多任务权重。
  • 使用独立的模型头计算元目标,以防止模型忽略辅助任务而仅关注最终任务。
  • 在元学习中采用一阶近似,以降低计算成本,同时保持性能。
  • 将该方法应用于两个领域中的低资源自然语言处理任务,使用现有的预训练模型作为初始化。
  • 采用双层优化设置:内层循环在组合目标上进行训练,外层循环基于最终任务性能更新元权重。

实验结果

研究问题

  • RQ1通过多任务学习实现的端到端任务感知训练,是否能在低资源自然语言处理设置中优于标准的端到端任务无关持续预训练?
  • RQ2与顺序预训练和微调相比,联合优化辅助任务与最终任务目标是否能提升数据效率与最终性能?
  • RQ3元学习能否自动平衡多个辅助目标与最终任务,以提升泛化能力与鲁棒性?
  • RQ4在此情境下,元学习的失败模式是什么?如何加以缓解?
  • RQ5端到端任务感知训练是否能减少对大量超参数调优与启发式预训练调度的依赖?

主要发现

  • MT-TARTAN在三个低资源自然语言处理任务上,显著优于Gururangan等人(2020)提出的标准持续预训练方法。
  • 所提方法提升了数据效率,使在更少训练数据下也能获得更优性能,优于基线预训练方法。
  • META-TARTAN通过元学习学习自适应多任务权重,在MT-TARTAN基础上进一步提升性能。
  • 使用独立头计算元目标可防止模型退化至忽略辅助任务的解,这是元学习中常见的失败模式。
  • 该方法减少了对手动超参数调优的依赖,因为元优化直接以最终任务验证性能为目标。
  • 实证结果表明,端到端任务感知训练相比传统预训练流程,能实现更好的泛化能力与更稳定的训练动态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。