Skip to main content
QUICK REVIEW

[论文解读] Reducing Retraining by Recycling Parameter-Efficient Prompts

Brian Lester, Joshua Yurtsever|arXiv (Cornell University)|Aug 10, 2022
Topic Modeling被引用 6
一句话总结

本文提出 Prompt Recycling 方法,通过利用模型嵌入之间的结构对应关系,实现将在源冻结大语言模型(LLM)上训练的软提示(soft prompts)无须微调地迁移至新目标 LLM,从而避免重新训练。最佳方法在 88.9% 的情况下成功回收了性能优于目标模型零样本性能的提示,但其性能仍落后于从零开始微调的提示。

ABSTRACT

Parameter-efficient methods are able to use a single frozen pre-trained large language model (LLM) to perform many tasks by learning task-specific soft prompts that modulate model behavior when concatenated to the input text. However, these learned prompts are tightly coupled to a given frozen model -- if the model is updated, corresponding new prompts need to be obtained. In this work, we propose and investigate several approaches to "Prompt Recycling'" where a prompt trained on a source model is transformed to work with the new target model. Our methods do not rely on supervised pairs of prompts, task-specific data, or training updates with the target model, which would be just as costly as re-tuning prompts with the target model from scratch. We show that recycling between models is possible (our best settings are able to successfully recycle $88.9\%$ of prompts, producing a prompt that out-performs baselines), but significant performance headroom remains, requiring improved recycling techniques.

研究动机与目标

  • 为解决每当冻结的 LLM 更新时重新训练软提示效率低下的问题,该问题成本高且耗时。
  • 实现无需任务特定数据或模型更新,将源 LLM 的特定任务提示迁移至新目标 LLM。
  • 探索是否可利用模型间的结构相似性,在不损失任务性能的前提下实现跨模型的提示转换。
  • 评估在不同模型规模和架构下提示回收的可行性与有效性。

提出的方法

  • 该方法基于源模型与目标模型之间词嵌入的对应关系,学习变换以将源模型的软提示映射为适用于目标模型的兼容提示。
  • 其依赖于模型间注意力层和嵌入空间的结构相似性,尤其关注不同模型间标记表示的对齐方式。
  • 提出了三种回收技术:线性投影、残差适配器,以及一种使用类别特定初始化与 SPoT(稀疏提示调优)以提升对齐度的方法。
  • 该方法无需成对提示、任务特定数据,也无需微调目标模型,从而保持计算效率。
  • 通过在下游任务(如 SST-2 和 IMDB)上将回收提示与零样本及随机提示基线进行比较,评估性能。
  • 在不同模型规模上进行了测试,包括从大模型到小模型(Large → Base)和从小模型到大模型(Base → Large)的回收。

实验结果

研究问题

  • RQ1能否在不重新训练的情况下,将源 LLM 上训练的软提示有效迁移至新目标 LLM?
  • RQ2回收提示的性能是否优于目标模型的零样本能力?
  • RQ3源模型与目标模型的规模如何影响提示回收的可靠性与性能?
  • RQ4是否可利用模型间的结构对应关系,在无需任务特定数据的前提下创建有效的提示转换?
  • RQ5从大模型向小模型回收提示,或从小模型向大模型回收提示,哪种方式更有效?

主要发现

  • 最佳回收方法成功回收了 88.9% 的提示,且其性能优于目标模型的零样本性能。
  • 从更大的源模型(Large)向更小的目标模型(Base)回收提示,其结果更可靠且性能更高,优于同规模模型间的回收。
  • 从小模型(Base)向大模型(Large)回收提示表现不稳定,方差高,且在 IMDB 数据集上常劣于随机提示。
  • 从 Large 到 Base 回收的提示性能优于零样本和随机提示基线,表明存在类似知识蒸馏的迁移潜力。
  • 回收提示的性能仍显著低于在目标模型上从零开始微调的提示,表明仍有巨大提升空间。
  • 回收成功率与提示的训练方式相关——在更大模型上训练的提示更易回收,可能由于其泛化能力更强或知识编码更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。