[论文解读] Fine-Tuning Pre-Trained Language Models Effectively by Optimizing Subnetworks Adaptively
本文提出动态参数选择(DPS),一种用于大规模预训练语言模型的新型自适应微调方法,该方法基于累积梯度在训练过程中动态选择与任务相关的子网络。DPS 在多种模型和低资源设置下提升了稳定性、泛化能力和性能,相较于先前方法在 GLUE 上最高提升 1.33 分,方差更小,仅带来微小的计算开销。
Large-scale pre-trained language models have achieved impressive results on a wide range of downstream tasks recently. However, fine-tuning an extremely large-scale pre-trained language model on limited target datasets is often plagued by overfitting and representation degradation. In this paper, we propose a Dynamic Parameter Selection (DPS) algorithm for the large-scale pre-trained models during fine-tuning, which adaptively selects a more promising subnetwork to perform staging updates based on gradients of back-propagation. Experiments on the GLUE benchmark show that DPS outperforms previous fine-tuning methods in terms of overall performance and stability, and consistently achieves better results with variable pre-trained language models. In addition, DPS brings a large magnitude of improvement in out-of-domain transferring experiments and low-resource scenarios, which shows that it can maintain stable general contextual features and reduce the representation collapse. We release our code at https://github.com/ZhangHaojie077/DPS
研究动机与目标
- 解决大规模预训练语言模型在小样本或分布外数据集上微调时的不稳定性和泛化能力差的问题。
- 克服现有子网络优化方法的局限性,如随机选择(Mixout)或静态子网络(CHILD-TUNING D),这些方法忽略动态参数重要性或带来高计算成本。
- 开发一种在微调过程中自适应选择有前景子网络的方法,且不将梯度累积与优化过程分离,从而降低开销。
- 在多种预训练模型、子网络规模和数据设置(包括低资源和分布外场景)下,提升模型的稳定性和泛化能力。
提出的方法
- DPS 采用循环的两阶段更新策略:第一阶段在微调过程中累积批次内更新参数的梯度。
- 第二阶段利用第一阶段累积的梯度,推导出特定阶段的重要参数子网络,仅更新这些参数,其余参数保持固定。
- 提出两种变体:DPS Dense 在第一阶段更新完整网络,在第二阶段更新动态子网络;DPS Mix 在第一阶段使用预训练权重替换输出权重,并在第二阶段应用频率惩罚的选择机制。
- 参数重要性通过梯度幅值排序(DPS Dense)或结合平均梯度值与更新频率的指数惩罚的混合度量(DPS Mix)来衡量。
- 通过将子网络推导整合到训练循环中,避免了外部梯度计算,最大限度减少额外计算成本。
- 该方法应用于多个预训练模型(BERT、RoBERTa、BART、ELECTRA、DeBERTa)在 GLUE 基准任务上的实验。
实验结果
研究问题
- RQ1在微调过程中自适应选择子网络是否能提升下游 NLP 任务的模型性能与稳定性?
- RQ2所提出的 DPS 方法是否能减少低资源和分布外场景下的过拟合与表征退化?
- RQ3与 Mixout 和 CHILD-TUNING D 等现有子网络优化方法相比,DPS 在效率和性能上表现如何?
- RQ4DPS 是否能在多种预训练模型架构和子网络规模下保持一致的性能提升?
主要发现
- 在 GLUE 基准上,DPS 相较于原始微调方法性能提升 0.44–1.33 分,标准差降低 0.29–0.80 分,表明稳定性显著提升。
- 在分布外迁移和低资源场景下,DPS 分别实现最高 1.86 和 3.27 分的绝对分数提升,展现出强大的泛化能力。
- 无论模型架构或预训练质量如何,DPS 在五种不同预训练模型(BERT、RoBERTa、BART、ELECTRA、DeBERTa)上均持续提升性能。
- 在足够训练数据的场景下(如 SST-2、QNLI),DPS 仍能带来性能增益(如 SST-2 上 +0.54),表明其在少样本设置之外也具备鲁棒性。
- DPS Dense 和 DPS Mix 分别带来 12% 和 30% 的训练时间增加,远低于 CHILD-TUNING D 的 313% 开销。
- 消融研究显示,DPS 在各种子网络规模下,比 Mixout 和 CHILD-TUNING D 更有效地捕捉与任务相关的参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。