[论文解读] Continual Domain-Tuning for Pretrained Language Models
本文提出持续学习(CL)方法——特别是弹性权重巩固(EWC)——以缓解预训练语言模型(如 BERT、RoBERTa)在领域微调过程中出现的灾难性遗忘。通过约束参数更新以保留源领域知识,EWC 在仅带来轻微计算开销的前提下,提升了下游任务的性能和对领域分布变化的鲁棒性,相较于标准领域微调(SDT)。
Pre-trained language models (LM) such as BERT, DistilBERT, and RoBERTa can be tuned for different domains (domain-tuning) by continuing the pre-training phase on a new target domain corpus. This simple domain tuning (SDT) technique has been widely used to create domain-tuned models such as BioBERT, SciBERT and ClinicalBERT. However, during the pretraining phase on the target domain, the LM models may catastrophically forget the patterns learned from their source domain. In this work, we study the effects of catastrophic forgetting on domain-tuned LM models and investigate methods that mitigate its negative effects. We propose continual learning (CL) based alternatives for SDT, that aim to reduce catastrophic forgetting. We show that these methods may increase the performance of LM models on downstream target domain tasks. Additionally, we also show that constraining the LM model from forgetting the source domain leads to downstream task models that are more robust to domain shifts. We analyze the computational cost of using our proposed CL methods and provide recommendations for computationally lightweight and effective CL domain-tuning procedures.
研究动机与目标
- 研究在将预训练语言模型适配至新领域时,标准领域微调(SDT)中灾难性遗忘的影响。
- 评估持续学习(CL)技术是否能减少在领域微调过程中对源领域知识的遗忘。
- 识别能提升正向迁移(对目标领域下游任务的性能提升)与负向迁移(对源领域下游任务的性能保持)的 CL 方法。
- 分析基于 CL 的领域微调的计算成本,并为实际部署推荐轻量化且高效的 CL 方法。
- 通过在微调过程中保留源领域表征,提升下游模型对领域分布变化的鲁棒性。
提出的方法
- 将五种成熟的 CL 方法——L2 正则化、弹性权重巩固(EWC)、经验回放(ER)、梯度回溯记忆(GEM)和正则化赫布学习(RH)——适配至领域微调场景。
- 利用来自小样本源领域数据(WikiText)计算 Fisher 信息矩阵近似值,以识别需保留的关键参数。
- 在目标领域语料上持续预训练期间施加 CL 约束,防止对影响源领域性能的关键参数进行大幅更新。
- 采用标准掩码语言建模(MLM)损失进行预训练,并在抽取式问答和自然语言蕴涵任务上进行微调。
- 将正向迁移(源预训练对目标任务的影响)与负向迁移(目标微调对源任务的影响)作为关键评估指标。
- 比较各方法的计算成本,发现 EWC 和 L2 的效率几乎与 SDT 相当,而 GEM 和 RH 因需对每个小批量计算梯度,成本约为 SDT 的两倍。
实验结果
研究问题
- RQ1灾难性遗忘如何影响标准领域微调(SDT)在目标领域下游任务上的性能?
- RQ2在预训练语言模型的领域微调过程中,哪些持续学习(CL)方法最有效地减少对源领域知识的遗忘?
- RQ3与 SDT 相比,基于 CL 的领域微调方法是否能提升正向迁移(目标任务性能)与负向迁移(源任务性能)?
- RQ4基于 CL 的领域微调的计算成本是多少?哪些方法在性能与效率之间提供了最佳权衡?
- RQ5基于 CL 的领域微调模型是否能提升下游微调中对领域分布变化的鲁棒性?
主要发现
- 弹性权重巩固(EWC)在性能与计算效率之间实现了最佳平衡,相比 SDT 展现出更优的负向迁移能力,且正向迁移能力具有竞争力。
- RH 在平均正向迁移上优于 EWC,但计算成本显著更高,使其在大模型中实用性较差。
- EWC 生成的潜在表征包含比 SDT 更多关于下游任务输出变量的信息,表明其具备更优的特征学习能力。
- 使用 EWC 微调权重初始化的下游模型在面对领域分布变化(如目标到源的迁移)时更具鲁棒性,表现出更强的泛化能力。
- 对于较小模型(如 DistilBERT),EWC 表现欠佳;GEM 和 RH 是更优替代方案,尽管计算成本更高。
- L2 和 EWC 的计算开销极低,仅比 SDT 略高,因此非常适合实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。