[论文解读] To Tune or Not To Tune? How About the Best of Both Worlds?
本文提出了一种针对预训练语言模型的两阶段微调方法:首先在冻结 BERT 参数的情况下训练特定任务的头网络,然后联合微调头网络与 BERT。该方法在语义相似性任务上实现了 4.7% 的准确率提升,在序列标注任务上提升了 0.99%,在文本分类任务上提升了 0.72%,表明 stack-and-finetune 方法优于标准的仅微调策略。
The introduction of pre-trained language models has revolutionized natural language research communities. However, researchers still know relatively little regarding their theoretical and empirical properties. In this regard, Peters et al. perform several experiments which demonstrate that it is better to adapt BERT with a light-weight task-specific head, rather than building a complex one on top of the pre-trained language model, and freeze the parameters in the said language model. However, there is another option to adopt. In this paper, we propose a new adaptation method which we first train the task model with the BERT parameters frozen and then fine-tune the entire model together. Our experimental results show that our model adaptation method can achieve 4.7% accuracy improvement in semantic similarity task, 0.99% accuracy improvement in sequence labeling task and 0.72% accuracy improvement in the text classification task.
研究动机与目标
- 探究两阶段训练策略(先用冻结的 BERT 微调任务头,再联合微调 BERT 与头网络)是否优于标准的仅微调方法。
- 评估在预训练语言模型之上进行架构设计的影响,特别是与简单添加头网络或基于词嵌入的策略进行对比。
- 探究在大型预训练模型的深度迁移学习中,过拟合缓解与梯度流动的作用。
- 确定在 BERT 表征结构基础上堆叠复杂神经网络是否能超越简单微调,特别是在针对 BERT 表征结构进行定制化设计时。
提出的方法
- 首先在冻结的 BERT 参数上训练特定任务的神经网络头,直至收敛,并通过监控训练与验证准确率的差距来检测过拟合。
- 然后联合微调 BERT 编码器与特定任务的头网络,以实现更好的参数对齐。
- 采用两阶段训练策略:第一阶段仅训练头网络(冻结 BERT),第二阶段进行端到端微调(所有参数均更新)。
- 在 BERT 上设计并评估多种网络架构,包括改进的 BIMPM 和一种 Sim-Transformer 变体,后者在匹配层中用 Transformer 替代双向 LSTM。
- 在第一阶段基于验证性能应用早停策略,以防止在联合微调前发生过拟合。
- 将结果与标准的仅微调基线模型以及仅使用 BERT 固定表征的模型进行对比,涵盖三个 NLP 任务:语义相似性、序列标注和文本分类。
实验结果
研究问题
- RQ1两阶段训练策略(先用冻结 BERT 微调头网络,再联合微调)是否优于标准的仅微调方法?
- RQ2在结合所提出的两阶段训练策略时,对 BERT 上游架构进行修改(如用 Transformer 替代双向 LSTM)是否能带来性能提升?
- RQ3在不同数据规模的 NLP 任务中,stack-and-finetune 与仅微调方法的性能表现如何比较?
- RQ4在微调具有高参数量的大规模预训练模型时,哪些训练策略最有效以防止过拟合?
- RQ5预训练模型的深度与结构在多大程度上影响顶层神经网络的设计与有效性?
主要发现
- 所提出的 stack-and-finetune 方法在语义相似性任务上相比仅微调基线模型实现了 4.7% 的准确率提升。
- 在序列标注任务中,该方法相比仅微调方法提高了 0.99% 的准确率。
- 在文本分类任务中,该方法相比仅微调策略获得了 0.72% 的准确率增益。
- Sim-Transformer 模型(用 Transformer 替代 BIMPM 中的双向 LSTM)在联合微调后表现优于 BIMPM,尽管在 BERT 冻结时性能较低。
- 在 BIMPM 中移除第一层双向 LSTM 对性能影响极小,表明 BERT 的表征本身已具备高度表达能力。
- 两阶段训练策略有效减少了过拟合并提升了泛化能力,尤其在结合对训练与验证准确率差距的仔细监控时效果更显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。