Skip to main content
QUICK REVIEW

[论文解读] BitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-models

Elad Ben Zaken, Shauli Ravfogel|arXiv (Cornell University)|Jun 18, 2021
Natural Language Processing Techniques被引用 10
一句话总结

BitFit 是一种参数高效的微调方法,仅更新预训练 BERT 模型的偏置项,在 GLUE 任务上达到与全量微调相当的性能,并在小到中等数据规模设置下优于全量微调。它通过仅修改 0.04% 的模型参数,实现了高效的多任务部署,支持与任务无关的流式学习,计算开销极低。

ABSTRACT

We introduce BitFit, a sparse-finetuning method where only the bias-terms of the model (or a subset of them) are being modified. We show that with small-to-medium training data, applying BitFit on pre-trained BERT models is competitive with (and sometimes better than) fine-tuning the entire model. For larger data, the method is competitive with other sparse fine-tuning methods. Besides their practical utility, these findings are relevant for the question of understanding the commonly-used process of finetuning: they support the hypothesis that finetuning is mainly about exposing knowledge induced by language-modeling training, rather than learning new task-specific linguistic knowledge.

研究动机与目标

  • 探索是否可以通过仅更新预训练 Transformer 模型中的偏置项,实现高度参数高效的微调。
  • 研究仅更新偏置项的微调是否能在低数据规模下达到或超越全量微调的性能。
  • 实现与任务无关、基于流式处理的多 NLP 模型高效部署,同时保持最小的内存和参数开销。
  • 理解偏置项在将预训练知识迁移至下游任务中的作用。
  • 挑战全参数更新对于有效微调是必要这一假设。

提出的方法

  • 冻结所有 Transformer 编码器权重,仅在所有层和注意力头中微调偏置项。
  • 在冻结的编码器之上保留一个特定于任务的分类头,与偏置项端到端联合训练。
  • 使用标准反向传播仅更新偏置参数,保持其他所有权重固定。
  • 在所有任务中应用相同的偏置更新策略,实现一致且可复用的模型权重。
  • 将微调限制在两个偏置组件上——查询和 MLP 中间层——实现 0.04% 的参数更新比例。
  • 在不同规模的训练数据下评估 GLUE 和 SQuAD 任务上的性能,以评估数据效率。

实验结果

研究问题

  • RQ1仅微调预训练 BERT 模型的偏置项,是否能达到与全量微调相当的性能?
  • RQ2在低数据规模下,仅更新偏置项的微调是否优于全量微调?
  • RQ3是否可以不重新训练,直接在多个下游任务中复用同一组更新后的偏置参数?
  • RQ4微调在多大程度上仅暴露了预训练阶段已学习的知识,而非学习新的语言模式?
  • RQ5偏置项在微调过程中如何影响模型行为的转变?

主要发现

  • BitFit 在所有 GLUE 任务上均达到与全量微调相当的性能,BERT BASE 在 SQuAD 上的精确匹配分数达到 97.2。
  • 在小到中等规模的训练数据下,BitFit 表现优于全量微调,尤其在 SQuAD v1.0 的小样本子集上表现更优。
  • 仅微调两个偏置组件(查询和 MLP 中间层)即可实现 0.04% 的参数更新比例,同时保持具有竞争力的准确率。
  • BitFit 保持了任务无关性:相同的偏置参数可在不同任务中复用而无需重新训练。
  • 该方法通过硬连线大部分模型参数,仅保留少数可变的偏置参数,实现了高效的硬件部署。
  • 结果支持这一假设:微调主要暴露了预训练阶段已学习的知识,而非学习新的语言知识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。