Skip to main content
QUICK REVIEW

[论文解读] ATTEMPT: Parameter-Efficient Multi-task Tuning via Attentional Mixtures of Soft Prompts

Akari Asai, Mohammadreza Salehi|arXiv (Cornell University)|May 24, 2022
Domain Adaptation and Few-Shot Learning被引用 16
一句话总结

ATTEMPT 提出了一种参数高效的多任务微调方法,通过注意力机制动态组合来自高资源源任务的软提示与新目标任务的提示,同时保持语言模型参数冻结。该方法在21个NLP数据集上实现了最先进性能,仅更新了全量微调参数量的0.4%,显著优于提示微调方法,并与全量微调模型性能相当,同时具备高度的效率与模块化特性。

ABSTRACT

This work introduces a new multi-task, parameter-efficient language model (LM) tuning method that learns to transfer knowledge across different tasks via a mixture of soft prompts-small prefix embedding vectors pre-trained for different tasks. Our method, called ATTEMPT (ATTEntional Mixtures of Prompt Tuning), obtains source prompts as encodings of large-scale source tasks into a small number of parameters and trains an attention module to interpolate the source prompts and a newly initialized target prompt for every instance in the target task. During training, only the target task prompt and the attention weights, which are shared between tasks in multi-task training, are updated, while the original LM and source prompts are intact. ATTEMPT is highly parameter-efficient (e.g., updates 2,300 times fewer parameters than full fine-tuning) while achieving high task performance using knowledge from high-resource tasks. Moreover, it is modular using pre-trained soft prompts, and can flexibly add or remove source prompts for effective knowledge transfer. Our experimental results across 21 diverse NLP datasets show that ATTEMPT significantly outperforms prompt tuning and outperforms or matches fully fine-tuned or other parameter-efficient tuning approaches that use over ten times more parameters. Finally, ATTEMPT outperforms previous work in few-shot learning settings.

研究动机与目标

  • 为解决现有参数高效微调方法仅依赖目标任务数据时效率低下且知识迁移能力有限的问题。
  • 在不微调语言模型的前提下,实现从高资源源任务到低资源目标任务的有效知识迁移。
  • 开发一种模块化、可解释且可复用的多任务学习框架,利用预训练的软提示。
  • 在保持或提升多样化NLP任务性能的同时,减少参数更新量,尤其在少样本设置下表现更优。
  • 通过学习注意力权重自动识别相关源任务,消除对任务相关性预计算先验的依赖。

提出的方法

  • 在大规模源任务上预训练软提示,生成可复用且可迁移的提示嵌入。
  • 为目标任务初始化一个特定于任务的软提示,并与注意力机制联合训练。
  • 使用轻量级共享注意力网络,为每个输入token计算源提示与目标提示的实例化加权组合。
  • 训练期间仅更新目标提示和共享注意力权重,保持语言模型与源提示冻结。
  • 将注意力加权的提示组合作为前缀应用于输入序列,由冻结的语言模型进行处理。
  • 支持在单个冻结模型上加载多个预加载的软提示,实现无需微调的多任务推理。

实验结果

研究问题

  • RQ1是否能够通过参数高效方法,在不微调语言模型的前提下,有效实现从多个高资源源任务到低资源目标任务的知识迁移?
  • RQ2与标准提示微调和全量微调相比,基于注意力机制的软提示混合方法在性能与参数效率方面表现如何?
  • RQ3注意力机制是否能够在不依赖预计算先验的情况下,学习到有意义的任务相似性并聚焦于相关源任务?
  • RQ4模块化提示组合在多任务学习中能在多大程度上提升性能与灵活性?
  • RQ5该方法在少样本学习与低资源设置下的有效性如何?

主要发现

  • ATTEMPT 在21个多样化NLP数据集上显著优于提示微调方法,仅更新全量微调参数量的0.4%,实现了最先进性能。
  • 该方法性能达到或超过全量微调模型及其他更新超过十倍参数的参数高效方法。
  • 在少样本学习设置(4–32样本)下,ATTEMPT 持续优于基线模型,展现出强大的泛化能力。
  • 消融实验证实,学习到的注意力权重、多任务学习以及来自多个源任务的模块化迁移是性能提升的关键因素。
  • 注意力分布揭示了有意义的任务相似性(如蕴涵判断与释义检测任务之间),表明实现了有效的知识迁移。
  • 该方法具有极高的参数效率,尤其在扩展至更大主干模型时,其他参数高效方法的可训练参数量迅速增加,而ATTEMPT则保持高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。