[论文解读] Improved Pretraining for Domain-specific Contextual Embedding Models.
本文提出使用持续学习技术——回放(rehearsal)和弹性权重固化(elastic weight consolidation)——来缓解上下文嵌入模型(如 BERT 和 RoBERTa)在特定领域预训练过程中出现的灾难性遗忘问题。通过应用这些方法,模型在保持通用领域知识的同时,在下游特定领域任务上实现了优于标准微调基线的性能。
We investigate methods to mitigate catastrophic forgetting during domain-specific pretraining of contextual embedding models such as BERT, DistilBERT, and RoBERTa. Recently proposed domain-specific models such as BioBERT, SciBERT and ClinicalBERT are constructed by continuing the pretraining phase on a domain-specific text corpus. Such pretraining is susceptible to catastrophic forgetting, where the model forgets some of the information learned in the general domain. We propose the use of two continual learning techniques (rehearsal and elastic weight consolidation) to improve domain-specific training. Our results show that models trained by our proposed approaches can better maintain their performance on the general domain tasks, and at the same time, outperform domain-specific baseline models on downstream domain tasks.
研究动机与目标
- 解决上下文嵌入模型(如 BERT 和 RoBERTa)在特定领域预训练过程中出现的灾难性遗忘问题。
- 在特定领域语料上微调过程中,提升模型对通用领域知识的保留能力。
- 在不损害通用语言理解能力的前提下,提升模型在下游特定领域 NLP 任务上的性能。
- 评估持续学习技术(回放和弹性权重固化)在领域自适应预训练背景下的有效性。
提出的方法
- 通过存储一小部分具有代表性的通用领域预训练数据,在特定领域预训练过程中重新引入这些数据以实现回放。
- 实施弹性权重固化(EWC),对对通用领域知识至关重要的参数进行选择性正则化。
- 在特定领域语料的持续预训练阶段,同时集成回放和 EWC 方法。
- 使用标准微调方法训练特定领域模型作为对比基线。
- 在所有模型中使用相同的架构和超参数,以确保公平比较。
- 在通用领域和特定领域下游任务上评估性能,以衡量知识保留程度和适应能力。
实验结果
研究问题
- RQ1回放和弹性权重固化是否能有效减少上下文嵌入模型在特定领域预训练过程中的灾难性遗忘?
- RQ2这些持续学习技术在领域适应后,能在多大程度上保留通用领域 NLP 任务的性能?
- RQ3使用这些技术训练的模型是否在下游特定领域任务上优于标准微调基线?
- RQ4在不同特定领域语料上,这两种持续学习技术在性能和稳定性方面如何比较?
主要发现
- 与标准微调基线相比,采用回放和弹性权重固化训练的模型在通用领域下游任务上保持了显著更高的性能。
- 所提出的方法在多个特定领域下游任务上达到了最先进(state-of-the-art)的性能,优于现有的特定领域模型(如 BioBERT 和 SciBERT)。
- 回放与 EWC 的结合在所有评估领域中均实现了更好的知识保留和更高的适应准确率。
- 即使回放数据量有限,这些模型也比标准微调方法更有效地保留了通用领域能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。