[论文解读] Exploring Versatile Generative Language Model Via Parameter-Efficient Transfer Learning
本文提出了一种参数高效的微调方法,可同时将单个预训练生成语言模型(如 GPT-2)适配至多个下游语言生成任务,采用残差适配器层与任务嵌入。通过每项任务仅增加 2–3% 的特定参数,该方法在性能上达到或优于全量微调,实现了高效的设备端部署。
Fine-tuning pre-trained generative language models to down-stream language generation tasks has shown promising results. However, this comes with the cost of having a single, large model for each task, which is not ideal in low-memory/power scenarios (e.g., mobile). In this paper, we propose an effective way to fine-tune multiple down-stream generation tasks simultaneously using a single, large pre-trained model. The experiments on five diverse language generation tasks show that by just using an additional 2-3% parameters for each task, our model can maintain or even improve the performance of fine-tuning the whole model.
研究动机与目标
- 为解决在低内存环境中为每个下游语言生成任务分别微调大型模型所带来的低效问题。
- 使单个预训练语言模型能够无需重训主干网络,即可动态支持多个多样化生成任务。
- 探索参数高效的微调技术,在最小化参数更新的同时保持或提升性能。
- 评估在多任务学习与持续学习设置下,参数高效适配中的权衡关系。
提出的方法
- 在每个 Transformer 块之后引入残差适配器层作为任务特定适配器,其可学习参数在主模型微调过程中保持冻结。
- 使用任务嵌入来控制适配器层,使模型能够根据任务动态调整其生成行为。
- 应用知识蒸馏技术,将全量微调模型的知识迁移至仅含适配器的模型,以提升性能。
- 在多任务学习(MT)与持续学习(CL)两种设置下进行训练,以比较泛化能力与灾难性遗忘表现。
- 冻结预训练语言模型的权重,仅微调适配器与任务嵌入参数,从而降低内存与计算开销。
- 在五个多样化任务中共享主干网络(如 GPT-2):摘要生成、机器翻译、对话生成、对话式问答与任务导向型自然语言生成。
实验结果
研究问题
- RQ1能否仅通过少量额外参数,有效将单个预训练语言模型适配至多个多样化语言生成任务?
- RQ2在多个生成任务上,参数高效适配的性能与全量微调相比如何?
- RQ3在多任务学习与持续学习背景下,冻结语言模型权重与微调其权重的影响分别是什么?
- RQ4知识蒸馏在提升基于适配器模型性能方面的有效性如何?
- RQ5任务嵌入是否能有效引导模型的生成输出朝向特定任务行为?
主要发现
- 所提方法在五个多样化语言生成任务上的平均性能达到 57.97 BLEU/F1,优于全量微调(57.77),且在仅使用基模型 1.13 倍参数量的情况下,达到或超过最先进结果。
- 每项任务仅增加 2–3% 的额外参数(通过适配器与任务嵌入实现),性能即保持或优于全量微调,证明了极高的参数效率。
- 采用蒸馏与适配器的模型(VLM)在摘要生成任务上达到 24.19 ROUGE-2 与 67.1 F1,优于全量微调(25.45 ROUGE-2,66.4 F1)及同类最先进系统。
- 移除任务嵌入后性能显著下降(如平均得分降至 47.25),表明其在任务特定适配中具有关键作用。
- 在持续学习(CL)设置下训练的模型在某些场景下泛化能力优于多任务学习(MT),表明 CL 更适合顺序任务部署。
- 在对话生成任务中,模型在 CoQA 上达到 66.2 F1,与最先进系统持平,并匹配参考人类性能,尽管参数量更少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。