[论文解读] Fusing finetuned models for better pretraining
本文提出通过平均多个微调模型的权重来融合,以创建一个用于下游任务的更优基础模型,显著优于标准预训练和模型间训练。该方法在多种自然语言处理基准测试中实现了更高的准确率和稳定性,计算成本极低,且对权重衰减具有鲁棒性。
Pretrained models are the standard starting point for training. This approach consistently outperforms the use of a random initialization. However, pretraining is a costly endeavour that few can undertake. In this paper, we create better base models at hardly any cost, by fusing multiple existing fine tuned models into one. Specifically, we fuse by averaging the weights of these models. We show that the fused model results surpass the pretrained model ones. We also show that fusing is often better than intertraining. We find that fusing is less dependent on the target task. Furthermore, weight decay nullifies intertraining effects but not those of fusing.
研究动机与目标
- 通过重用现有微调模型而非从头训练,解决预训练的高成本问题。
- 在不进行额外预训练的情况下,提升下游任务的基础模型质量。
- 探究结合多个微调模型是否能产生优于单模型间训练的初始化效果。
- 评估融合方法对超参数(如权重衰减)选择的鲁棒性。
- 通过使用微调模型构建更优的预训练模型,实现对传统迁移学习范式的逆转。
提出的方法
- 融合被定义为通过平均多个微调模型的权重来创建一个新的基础模型。
- 融合模型初始化为 $ W_{fuse} = \frac{1}{n} \sum_{i=1}^{n} W_i $,其中 $ W_i $ 为第 $ i $ 个微调模型的权重。
- 该方法利用来自多样化源任务的现有微调模型,来初始化一个性能更优的新基础模型。
- 实验在三个数据集族(通用(GLUE/SuperGLUE)、自然语言推理(NLI)和推特(Twitter))的30个数据集上,对比了融合方法与标准预训练和间训练的效果。
- 在微调过程中应用权重衰减,以评估其对融合与间训练性能的影响。
- 通过准确率和标准差来评估方法,以衡量性能与训练稳定性。
实验结果
研究问题
- RQ1通过融合多个微调模型,能否产生优于标准预训练的更好基础模型?
- RQ2当使用相同的源模型时,融合是否能持续优于间训练?
- RQ3权重衰减如何影响融合与间训练的性能表现?
- RQ4融合方法对微调模型中源任务和领域的选择是否具有鲁棒性?
- RQ5融合来自多样化任务的模型是否能产生更具泛化能力的基础模型?
主要发现
- 在30个数据集上,融合微调模型在T5模型上的表现持续优于标准预训练,准确率更高且方差更低。
- 在结合表现最佳的两个微调模型时,融合方法的性能优于间训练,NLI任务上平均准确率提升1.61%,Twitter任务上提升2.27%。
- 融合模型的标准差始终低于从预训练基础模型微调的模型,表明训练稳定性得到提升。
- 权重衰减严重损害了间训练的性能,但对融合方法影响极小,显示出融合方法的鲁棒性。
- 融合方法对特定目标任务的依赖性更弱,在多样化自然语言处理基准上展现出更强的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。