Skip to main content
QUICK REVIEW

[论文解读] AdaMix: Mixture-of-Adaptations for Parameter-efficient Model Tuning

Yaqing Wang, Agarwal, Sahaj|arXiv (Cornell University)|May 24, 2022
Topic Modeling被引用 12
一句话总结

AdaMix 提出了一种参数高效微调方法,通过在每个 Transformer 层中训练适应模块(如适配器或 LoRA)的混合体来提升性能,使用随机路由机制为每个输入选择一个模块,同时保持与单个模块相同的 FLOPs 和可训练参数量。通过仅微调模型参数的 0.1–0.2%,AdaMix 在自然语言理解(NLU)和自然语言生成(NLG)任务上均优于标准全参数微调和当前最先进(SOTA)的参数高效微调(PEFT)方法。

ABSTRACT

Standard fine-tuning of large pre-trained language models (PLMs) for downstream tasks requires updating hundreds of millions to billions of parameters, and storing a large copy of the PLM weights for every task resulting in increased cost for storing, sharing and serving the models. To address this, parameter-efficient fine-tuning (PEFT) techniques were introduced where small trainable components are injected in the PLM and updated during fine-tuning. We propose AdaMix as a general PEFT method that tunes a mixture of adaptation modules -- given the underlying PEFT method of choice -- introduced in each Transformer layer while keeping most of the PLM weights frozen. For instance, AdaMix can leverage a mixture of adapters like Houlsby or a mixture of low rank decomposition matrices like LoRA to improve downstream task performance over the corresponding PEFT methods for fully supervised and few-shot NLU and NLG tasks. Further, we design AdaMix such that it matches the same computational cost and the number of tunable parameters as the underlying PEFT method. By only tuning 0.1-0.2% of PLM parameters, we show that AdaMix outperforms SOTA parameter-efficient fine-tuning and full model fine-tuning for both NLU and NLG tasks.

研究动机与目标

  • 为解决大规模预训练语言模型(PLMs)中全参数微调带来的高存储、共享与服务成本问题,后者需为每个任务更新并存储数十亿参数。
  • 提升现有参数高效微调(PEFT)方法的性能,尽管其可训练参数量已大幅减少,但通常仍低于全参数微调的性能表现。
  • 构建一种通用的 PEFT 框架,通过适应模块的混合体提升任意底层 PEFT 方法(如适配器或 LoRA)的性能,且不增加计算成本。
  • 通过保持可训练参数量和 FLOPs 与基础 PEFT 方法相同,实现效率最大化,同时借助模块融合与一致性正则化提升鲁棒性与性能。

提出的方法

  • AdaMix 在每个 Transformer 层中引入多个适应模块(如适配器或 LoRA 矩阵),取代标准 PEFT 中使用的单个模块。
  • 采用随机路由机制,为每个输入选择一个活跃的适应模块,灵感来源于专家混合(MoE),确保计算量(FLOP)与单个模块相同。
  • 通过一致性正则化与多个随机初始化模块的共享初始化,稳定训练过程,即使在使用随机路由时亦能保持稳定。
  • 引入一种后训练融合机制,将多个适应模块的权重平均合并为一个有效模块,保持与基础 PEFT 方法相同的可训练参数量。
  • 该融合过程受到模型权重平均(如模型汤)的启发,但专门应用于 PEFT 适应模块,而非整个模型。
  • 该方法与现有 PEFT 技术正交,可无缝集成到任意 PEFT 方法之上,包括适配器、LoRA、提示微调(prompt-tuning)或前缀微调(prefix-tuning)。

实验结果

研究问题

  • RQ1在不增加计算成本的前提下,适应模块的混合体是否能提升参数高效微调的下游性能?
  • RQ2在多个适应模块之间采用随机路由是否能带来相比单模块 PEFT 更好的泛化性与鲁棒性?
  • RQ3一致性正则化与权重融合是否能稳定训练过程,并在使用多个随机初始化的适应模块时保持性能?
  • RQ4AdaMix 是否在仅微调 0.1–0.2% 模型参数的前提下,优于标准全参数微调与当前最先进 PEFT 方法?
  • RQ5AdaMix 框架是否可泛化至不同 PEFT 方法(如适配器与 LoRA)?

主要发现

  • 在使用 RoBERTa-large 的 GLUE 基准上,AdaMix 仅微调 0.1–0.2% 的参数,即达到 91.0% 的平均得分,优于全模型微调。
  • 在 SuperGLUE 基准上,AdaMix 搭配适配器实现 90.7% 的平均得分,超过标准 LoRA 的 89.2% 与标准适配器的 90.9%。
  • 在 CNN/DailyMail 文本摘要任务中,AdaMix 搭配 LoRA 实现 42.1 的 ROUGE-L 得分,超过标准 LoRA 的 40.8 与标准适配器的 41.5。
  • AdaMix 保持与基础 PEFT 方法相同的 FLOPs 与可训练参数量,同时在 NLU 与 NLG 任务中均实现性能提升。
  • 该方法在 GLUE 与 SuperGLUE 基准上均达到最先进水平,即使仅微调 0.1–0.2% 的模型参数。
  • 融合机制成功通过将多个适应模块合并为一个,显著降低存储成本,且未造成性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。