[论文解读] An Embarrassingly Simple Approach for Transfer Learning from Pretrained Language Models
该论文提出 SiATL,一种简单而有效的迁移学习方法,通过结合任务特定损失与衰减的辅助语言建模损失,微调预训练语言模型以实现文本分类。该方法可防止灾难性遗忘,在多个情感分析与文本分类任务上达到最先进性能,即使在训练数据有限的情况下,也优于 ULMFiT 等复杂方法。
A growing number of state-of-the-art transfer learning methods employ language models pretrained on large generic corpora. In this paper we present a conceptually simple and effective transfer learning approach that addresses the problem of catastrophic forgetting. Specifically, we combine the task-specific optimization function with an auxiliary language model objective, which is adjusted during the training process. This preserves language regularities captured by language models, while enabling sufficient adaptation for solving the target task. Our method does not require pretraining or finetuning separate components of the network and we train our models end-to-end in a single step. We present results on a variety of challenging affective and text classification tasks, surpassing well established transfer learning methods with greater level of complexity.
研究动机与目标
- 解决在微调过程中从预训练语言模型进行迁移学习时的灾难性遗忘问题。
- 开发一种计算效率高且概念简单的方法,避免复杂的调度策略或多阶段训练。
- 通过在适应任务特定分布的同时保留通用语言规律,提升低资源文本分类任务的性能。
- 证明端到端训练结合加权辅助损失可优于更复杂的迁移学习流程。
提出的方法
- 将预训练语言模型(在 Twitter 语料上训练)的权重迁移至带有任务特定循环层和分类头的分类器。
- 使用多任务目标端到端训练整个模型:任务特定分类损失与辅助语言建模损失的加权和。
- 在训练轮次中逐步衰减语言建模损失的权重系数 γ(例如,从初始值 0.2 逐渐降低至最终值 0.1),以随时间减少其影响。
- 采用顺序解冻策略,从顶层开始逐步更新预训练语言模型的层,以在不覆盖已学习表征的情况下实现领域适应。
- 采用单步端到端训练流程,无需单独的预训练、微调或迁移阶段。
- 通过超参数 γ 控制保留语言模型知识与适应目标任务之间的权衡,该参数随时间衰减。
实验结果
研究问题
- RQ1是否可通过带有辅助语言建模目标的简单单步训练流程,有效防止从预训练语言模型迁移学习过程中的灾难性遗忘?
- RQ2在低资源条件下,该方法与 ULMFiT 等更复杂的迁移学习流程相比性能如何?
- RQ3使用衰减的辅助损失是否能提升多样本文本分类任务中的泛化能力与模型鲁棒性?
- RQ4当预训练数据与目标数据集之间存在领域差异时,顺序解冻在多大程度上能提升性能?
- RQ5该方法是否可在无需任务特定架构修改或复杂学习率调度的情况下实现具有竞争力的结果?
主要发现
- SiATL 在所有评估的文本分类任务中均优于 ULMFiT,包括训练样本少于 1,000 个的小型数据集。
- 在 SCv2 数据集上,SiATL 的性能非常接近最先进模型(Ilic et al., 2018),展现出强大的低资源泛化能力。
- 辅助语言建模损失显著提升性能:P-LM + aux 模型在所有下游任务中均优于 P-LM 模型,证实其在缓解灾难性遗忘中的关键作用。
- 在 SCv1 数据集上,SiATL 实现了 7% 的性能提升,表明当目标词汇表受限时,辅助损失可实现更好的适应性。
- 顺序解冻在非 Twitter 领域任务(如 PsychExp、SCv2)中带来显著性能提升,凸显其在领域适应中的重要性。
- 该方法对 γ 的衰减策略具有鲁棒性:指数衰减与线性衰减表现相似,表明对超参数调优不敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。