Skip to main content
QUICK REVIEW

[论文解读] Recall and Learn: Fine-tuning Deep Pretrained Language Models with Less Forgetting

Sanyuan Chen, Yutai Hou|arXiv (Cornell University)|Apr 27, 2020
Topic Modeling参考文献 67被引用 10
一句话总结

该论文提出了一种回忆与学习机制,通过在不访问预训练数据的情况下联合学习预训练任务和下游任务,以减少微调深度预训练语言模型时的灾难性遗忘。该方法引入了预训练模拟(Pretraining Simulation)以仅使用预训练权重来回忆知识,并采用目标转移(Objective Shifting)逐步聚焦于下游任务,从而在GLUE基准上取得了最先进结果,BERT-base的性能甚至超越了BERT-large,并发布了开源的RecAdam优化器以促进更广泛的应用。

ABSTRACT

Deep pretrained language models have achieved great success in the way of pretraining first and then fine-tuning. But such a sequential transfer learning paradigm often confronts the catastrophic forgetting problem and leads to sub-optimal performance. To fine-tune with less forgetting, we propose a recall and learn mechanism, which adopts the idea of multi-task learning and jointly learns pretraining tasks and downstream tasks. Specifically, we propose a Pretraining Simulation mechanism to recall the knowledge from pretraining tasks without data, and an Objective Shifting mechanism to focus the learning on downstream tasks gradually. Experiments show that our method achieves state-of-the-art performance on the GLUE benchmark. Our method also enables BERT-base to achieve better performance than directly fine-tuning of BERT-large. Further, we provide the open-source RecAdam optimizer, which integrates the proposed mechanisms into Adam optimizer, to facility the NLP community.

研究动机与目标

  • 解决在微调过程中深度预训练语言模型进行顺序迁移学习时的灾难性遗忘问题。
  • 在无需访问大规模预训练数据的情况下,实现预训练任务与下游任务的多任务学习。
  • 通过动态目标加权,平衡从预训练中保留的知识与有效学习下游任务之间的关系。
  • 开发一种实用的优化器,集成上述机制,便于在自然语言处理研究与应用中轻松采用。

提出的方法

  • 提出一种预训练模拟(Pretraining Simulation)机制,仅使用预训练模型参数重建预训练目标(如掩码语言建模),而无需原始训练数据访问。
  • 引入一种目标转移(Objective Shifting)机制,在训练过程中逐步增加下游任务的损失权重,同时减少预训练任务的损失权重。
  • 设计一种可微分、参数高效的策略,利用冻结的预训练模型的logits和梯度来模拟预训练任务的监督信号。
  • 将回忆与学习机制集成到Adam优化器中,从而开发出开源的RecAdam优化器,支持即插即用。
  • 采用从预训练模型参数近似得到的二次正则化项,以稳定学习过程并减少遗忘。
  • 使用一种动态损失加权策略,在训练周期中从关注预训练任务逐渐过渡到关注下游任务。

实验结果

研究问题

  • RQ1在不访问预训练数据的情况下,能否有效将多任务学习应用于深度预训练语言模型的微调?
  • RQ2在仅使用预训练模型参数的情况下,如何在下游微调过程中回忆并保留预训练知识?
  • RQ3何种动态损失加权策略能够更好地平衡预训练知识保留与下游任务学习之间的关系?
  • RQ4联合学习机制是否能在下游性能与遗忘减少方面优于标准微调方法?

主要发现

  • 所提方法在GLUE基准上实现了最先进性能,优于标准微调和现有基线方法。
  • 使用该方法微调的BERT-base在GLUE上的表现优于直接微调BERT-large,表明其显著减少了灾难性遗忘。
  • 即使使用随机参数初始化,该方法仍能实现优异性能,表明回忆机制能有效重新捕获预训练知识。
  • 集成所提机制的RecAdam优化器在多个NLP任务中均实现一致性能提升,且实现开销极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。