[论文解读] Parameter-Efficient Tuning on Layer Normalization for Pre-trained Language Models
本文提出LN-tuning,一种参数高效的方法,仅微调预训练语言模型中层归一化(Layer Normalization)的可学习缩放参数(γ)和偏置参数(β),在仅使用不到0.1%的可训练参数(具体为0.03%)的情况下实现最先进性能,并具备高训练效率。此外,实验表明将LN-tuning与prefix-tuning结合使用,相比统一的适配器方法,可取得更优结果。
Conventional fine-tuning encounters increasing difficulties given the size of current Pre-trained Language Models, which makes parameter-efficient tuning become the focal point of frontier research. Previous methods in this field add tunable adapters into MHA or/and FFN of Transformer blocks to enable PLMs achieve transferability. However, as an important part of Transformer architecture, the power of layer normalization for parameter-efficent tuning is ignored. In this paper, we first propose LN-tuning, by tuning the gain and bias term of Layer Normalization module with only 0.03\% parameters, which is of high time-efficency and significantly superior to baselines which are less than 0.1\% tunable parameters. Further, we study the unified framework of combining LN-tuning with previous ones and we find that: (1) the unified framework of combining prefix-tuning, the adapter-based method working on MHA, and LN-tuning achieves SOTA performance. (2) unified framework which tunes MHA and LayerNorm simultaneously can get performance improvement but those which tune FFN and LayerNorm simultaneous will cause performance decrease. Ablation study validates LN-tuning is of no abundant parameters and gives a further understanding of it.
研究动机与目标
- 探索层归一化(LayerNorm)在预训练语言模型(PLMs)中用于参数高效微调的未被发掘潜力,尽管其在Transformer架构中扮演关键角色,但此前被忽视。
- 通过引入仅修改极小部分参数的轻量级微调方法,解决大规模PLM全量微调的低效与高成本问题。
- 研究将LN-tuning与现有参数高效技术(如prefix-tuning和适配器方法)在统一框架中结合的有效性。
- 通过消融研究和对各层及任务中缩放与偏置项变化的可视化,理解LN-tuning的行为与影响。
提出的方法
- 提出LN-tuning,一种新方法,在LayerNorm模块中引入可学习的缩放参数(γ)和偏置参数(β),仅微调这些参数,其余所有PLM权重保持冻结。
- 仅在每个Transformer块中Multi-Head Attention(MHA)和Feed-Forward Network(FFN)之后的LayerNorm层上应用LN-tuning,实现极小的参数更新量与高效率。
- 在统一框架中将LN-tuning与prefix-tuning结合,联合优化MHA中的连续提示向量与LayerNorm参数。
- 通过消融研究分析单个缩放与偏置项的贡献,以及其在不同层与模型尺寸下的变化。
- 使用可视化技术跟踪各层中缩放与偏置项绝对变化量,采用L1范数:$\frac{1}{\text{dim}(\bm{t})}\|\bm{t}_{o}-\bm{t}_{f}\|_{1}$,以理解微调过程中的参数动态。
- 在包括文本分类、命名实体识别和问答在内的多种自然语言理解(NLU)任务上评估性能,以评估泛化能力与可扩展性。
实验结果
研究问题
- RQ1能否有效利用LayerNorm的缩放与偏置参数,实现预训练语言模型的参数高效微调?
- RQ2当可训练参数少于0.1%时,LN-tuning在性能与效率上与现有适配器方法及提示微调方法相比如何?
- RQ3将LN-tuning与prefix-tuning或适配器方法结合使用,对下游任务性能有何影响?
- RQ4为何同时微调FFN与LayerNorm会降低性能,而同时微调MHA与LayerNorm则能提升性能?
- RQ5所学习的缩放与偏置参数在不同层、任务与模型尺寸下如何变化?这揭示了其在模型适应中的作用?
主要发现
- LN-tuning仅需模型0.03%的参数可训练,即可实现具有竞争力的性能,其参数效率显著优于标准微调及其他参数高效方法。
- 将prefix-tuning与LN-tuning结合的统一框架在多个NLU基准上实现最先进性能,超越MAM(一种同时微调MHA与FFN的统一适配器方法)。
- 在单一框架中同时微调MHA与LayerNorm可提升性能,但同时微调FFN与LayerNorm则导致性能下降,表明这两者之间存在负面交互。
- LayerNorm的缩放与偏置参数在深层(如第15–24层)变化显著,尤其在大模型中,表明深层对领域与任务变化更敏感。
- 参数变化程度与任务复杂度及数据集规模相关:问答任务(CSQA)与命名实体识别任务(Twitter)的参数变化大于简单的二分类任务(如SST-2),且更大数据集引发更多参数变化。
- 可视化结果表明,深层中缩放项的变化幅度远大于偏置项,且在复杂或大规模任务中变化量更大,表明缩放适应在领域适应中起更突出作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。