Skip to main content
QUICK REVIEW

[论文解读] On the Effectiveness of Adapter-based Tuning for Pretrained Language Model Adaptation

Ruidan He, Linlin Liu|arXiv (Cornell University)|Jun 6, 2021
Topic Modeling参考文献 24被引用 14
一句话总结

本文研究了基于适配器的微调作为一种参数高效替代全量微调的方法,用于预训练语言模型(PrLM),并表明其通过减少表示与原始PrLM的偏差,更好地实现了正则化。实验表明,在低资源和跨语言设置下,适配器优于微调,且对学习率变化更具鲁棒性,过拟合现象也更少。

ABSTRACT

Adapter-based tuning has recently arisen as an alternative to fine-tuning. It works by adding light-weight adapter modules to a pretrained language model (PrLM) and only updating the parameters of adapter modules when learning on a downstream task. As such, it adds only a few trainable parameters per new task, allowing a high degree of parameter sharing. Prior studies have shown that adapter-based tuning often achieves comparable results to fine-tuning. However, existing work only focuses on the parameter-efficient aspect of adapter-based tuning while lacking further investigation on its effectiveness. In this paper, we study the latter. We first show that adapter-based tuning better mitigates forgetting issues than fine-tuning since it yields representations with less deviation from those generated by the initial PrLM. We then empirically compare the two tuning methods on several downstream NLP tasks and settings. We demonstrate that 1) adapter-based tuning outperforms fine-tuning on low-resource and cross-lingual tasks; 2) it is more robust to overfitting and less sensitive to changes in learning rates.

研究动机与目标

  • 评估基于适配器的微调是否在参数效率之外还具备其他优势。
  • 探究适配器是否比全量微调更能缓解灾难性遗忘。
  • 在多种自然语言处理任务和设置下,比较基于适配器的微调与全量微调的泛化能力和鲁棒性。
  • 分析适配器在低资源和跨语言迁移学习场景下的有效性。
  • 评估对学习率等超参数的敏感性,以及模型容量的影响。

提出的方法

  • 在预训练语言模型的Transformer层之间插入轻量级适配器模块——包含下投影、非线性激活(tanh)和上投影。
  • 在微调过程中冻结所有原始PrLM参数,仅更新适配器模块的参数。
  • 使用表示相似性分析(RSA)测量微调后隐藏表示与原始PrLM的偏差。
  • 在适配器中引入跳跃连接,使得当适配器权重接近零时可实现恒等映射,从而保留初始表示。
  • 使用BERT-base在多个自然语言处理任务上进行对比,包括GLUE、XNLI和下游分类任务。
  • 在不同学习率、数据量和零样本跨语言迁移设置下,评估泛化能力和稳定性。

实验结果

研究问题

  • RQ1与全量微调相比,基于适配器的微调是否能更有效地减少表示与原始PrLM的偏差,从而体现更好的正则化?
  • RQ2在低资源和高资源设置下,基于适配器的微调相对于全量微调表现如何?
  • RQ3基于适配器的微调是否对超参数变化(尤其是学习率变化)表现出更强的鲁棒性?
  • RQ4与全量微调相比,基于适配器的微调在零样本跨语言迁移学习中的有效性如何?
  • RQ5当结合如mixout等正则化技术时,基于适配器的微调是否仍能优于全量微调?

主要发现

  • 基于适配器的微调比全量微调更有效地减少表示与原始PrLM的偏差,表明其正则化效果更好,遗忘现象更少。
  • 在低资源设置下,基于适配器的微调优于全量微调,尤其在领域特定任务中表现更优,且随着数据量增加,性能差距逐渐缩小。
  • 在所有数据设置下,基于适配器的微调在零样本跨语言迁移任务中均取得更优结果,展现出对未见语言的强大泛化能力。
  • 与全量微调相比,基于适配器的微调对学习率超参数变化表现出显著更强的鲁棒性,不同学习率下的性能波动更小。
  • 在与mixout正则化的消融实验中,仅使用适配器的微调性能优于经过mixout正则化的全量微调;而将mixout应用于适配器时,性能反而下降,原因在于可训练参数有限。
  • 适配器与全量微调之间的性能差距在低资源和跨语言场景下最为显著,凸显了适配器在参数高效微调中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。