Skip to main content
QUICK REVIEW

[论文解读] Raise a Child in Large Language Model: Towards Effective and Generalizable Fine-tuning

Runxin Xu, Fuli Luo|arXiv (Cornell University)|Sep 13, 2021
Topic Modeling参考文献 33被引用 4
一句话总结

本文提出了一种名为 Child-Tuning 的新型微调方法,通过在反向传播过程中使用梯度掩码,仅选择性地更新部分参数(即“子网络”),从而提升大型语言模型的性能与泛化能力。该方法在原始微调基础上实现了最高达 8.6 分的性能提升,并在 GLUE 基准测试和迁移学习场景中持续优于先前的方法。

ABSTRACT

Recent pretrained language models extend from millions to billions of parameters. Thus the need to fine-tune an extremely large pretrained model with a limited training corpus arises in various downstream tasks. In this paper, we propose a straightforward yet effective fine-tuning technique, Child-Tuning, which updates a subset of parameters (called child network) of large pretrained models via strategically masking out the gradients of the non-child network during the backward process. Experiments on various downstream tasks in GLUE benchmark show that Child-Tuning consistently outperforms the vanilla fine-tuning by 1.5~8.6 average score among four different pretrained models, and surpasses the prior fine-tuning techniques by 0.6~1.3 points. Furthermore, empirical results on domain transfer and task transfer show that Child-Tuning can obtain better generalization performance by large margins.

研究动机与目标

  • 解决在有限数据上微调大规模预训练语言模型时常见的过拟合与泛化能力差的问题。
  • 通过仅将参数更新限制在模型的子集,降低知识遗忘的风险。
  • 开发一种方法,在不增加参数数量的前提下,同时提升模型在域内和域外迁移任务中的性能。
  • 探索无任务依赖与任务驱动的策略,以识别最适合微调的参数子网络(子网络)。
  • 提供一种与现有正则化方法和参数高效微调方法正交的技术,使其在与其他方法结合时可进一步提升性能。

提出的方法

  • 在反向传播过程中应用梯度掩码,将子网络外所有参数的梯度置零,仅允许子网络参数被更新。
  • 采用无任务依赖的方法(Child-Tuning F),对完整梯度应用伯努利掩码,引入随机性以实现正则化。
  • 采用任务驱动的方法(Child-Tuning D),通过费舍尔信息矩阵(Fisher Information Matrix, FIM)识别最相关的参数,并对非子网络参数的梯度进行掩码。
  • 在完整模型上保持前向传播,以保留预训练权重中的知识,与模型剪枝方法不同。
  • 在训练前通过 FIM 检测子网络,从而在微调过程中实现高效的梯度掩码。
  • 通过将梯度掩码作为后处理步骤集成到现有方法中,使 Child-Tuning 与其它正则化技术正交,提升兼容性。

实验结果

研究问题

  • RQ1通过梯度掩码实现选择性参数更新,是否能提升在小型、域内数据集上的微调性能?
  • RQ2与原始微调相比,Child-Tuning 是否能在域外和跨任务迁移设置中提升泛化能力?
  • RQ3在性能与鲁棒性方面,无任务依赖变体(Child-Tuning F)与任务驱动变体(Child-Tuning D)相比如何?
  • RQ4Child-Tuning 与现有微调技术结合后,能在多大程度上进一步提升性能?
  • RQ5所识别的子网络在不同自然语言处理任务中是否具有稳定性和可迁移性?

主要发现

  • 在 GLUE 基准测试中,Child-Tuning 在四种不同预训练模型上,平均性能较原始微调提升 1.5–8.6 分。
  • 在相同基准测试中,Child-Tuning 平均优于先前的 SOTA 微调方法 0.6–1.3 分。
  • 在领域迁移与任务迁移设置中,Child-Tuning 显著提升了泛化性能,且在相似任务间子网络选择的重叠度更高。
  • 任务驱动的子网络选择(Child-Tuning D)在 NLI 任务(如 RTE、QNLI 和 MNLI)中表现出较高的 Jaccard 相似度(最高约 0.7),表明能一致识别出相关参数。
  • 无任务依赖的变体 Child-Tuning F 通过梯度噪声注入,降低了在小型数据集上的过拟合风险,提升了泛化能力,且在检测阶段无需使用任务数据。
  • 将 Child-Tuning 与现有方法结合可进一步提升性能,证实了其正交性及与当前微调范式的兼容性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。