[论文解读] Reducing Retraining by Recycling Parameter-Efficient Prompts
本文提出 Prompt Recycling 方法,通过利用模型嵌入之间的结构对应关系,实现将在源冻结大语言模型(LLM)上训练的软提示(soft prompts)无须微调地迁移至新目标 LLM,从而避免重新训练。最佳方法在 88.9% 的情况下成功回收了性能优于目标模型零样本性能的提示,但其性能仍落后于从零开始微调的提示。
Parameter-efficient methods are able to use a single frozen pre-trained large language model (LLM) to perform many tasks by learning task-specific soft prompts that modulate model behavior when concatenated to the input text. However, these learned prompts are tightly coupled to a given frozen model -- if the model is updated, corresponding new prompts need to be obtained. In this work, we propose and investigate several approaches to "Prompt Recycling'" where a prompt trained on a source model is transformed to work with the new target model. Our methods do not rely on supervised pairs of prompts, task-specific data, or training updates with the target model, which would be just as costly as re-tuning prompts with the target model from scratch. We show that recycling between models is possible (our best settings are able to successfully recycle $88.9\%$ of prompts, producing a prompt that out-performs baselines), but significant performance headroom remains, requiring improved recycling techniques.
研究动机与目标
- 为解决每当冻结的 LLM 更新时重新训练软提示效率低下的问题,该问题成本高且耗时。
- 实现无需任务特定数据或模型更新,将源 LLM 的特定任务提示迁移至新目标 LLM。
- 探索是否可利用模型间的结构相似性,在不损失任务性能的前提下实现跨模型的提示转换。
- 评估在不同模型规模和架构下提示回收的可行性与有效性。
提出的方法
- 该方法基于源模型与目标模型之间词嵌入的对应关系,学习变换以将源模型的软提示映射为适用于目标模型的兼容提示。
- 其依赖于模型间注意力层和嵌入空间的结构相似性,尤其关注不同模型间标记表示的对齐方式。
- 提出了三种回收技术:线性投影、残差适配器,以及一种使用类别特定初始化与 SPoT(稀疏提示调优)以提升对齐度的方法。
- 该方法无需成对提示、任务特定数据,也无需微调目标模型,从而保持计算效率。
- 通过在下游任务(如 SST-2 和 IMDB)上将回收提示与零样本及随机提示基线进行比较,评估性能。
- 在不同模型规模上进行了测试,包括从大模型到小模型(Large → Base)和从小模型到大模型(Base → Large)的回收。
实验结果
研究问题
- RQ1能否在不重新训练的情况下,将源 LLM 上训练的软提示有效迁移至新目标 LLM?
- RQ2回收提示的性能是否优于目标模型的零样本能力?
- RQ3源模型与目标模型的规模如何影响提示回收的可靠性与性能?
- RQ4是否可利用模型间的结构对应关系,在无需任务特定数据的前提下创建有效的提示转换?
- RQ5从大模型向小模型回收提示,或从小模型向大模型回收提示,哪种方式更有效?
主要发现
- 最佳回收方法成功回收了 88.9% 的提示,且其性能优于目标模型的零样本性能。
- 从更大的源模型(Large)向更小的目标模型(Base)回收提示,其结果更可靠且性能更高,优于同规模模型间的回收。
- 从小模型(Base)向大模型(Large)回收提示表现不稳定,方差高,且在 IMDB 数据集上常劣于随机提示。
- 从 Large 到 Base 回收的提示性能优于零样本和随机提示基线,表明存在类似知识蒸馏的迁移潜力。
- 回收提示的性能仍显著低于在目标模型上从零开始微调的提示,表明仍有巨大提升空间。
- 回收成功率与提示的训练方式相关——在更大模型上训练的提示更易回收,可能由于其泛化能力更强或知识编码更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。