Skip to main content
QUICK REVIEW

[论文解读] Prompt Injection: Parameterization of Fixed Inputs

Eunbi Choi, Yongrae Jo|arXiv (Cornell University)|May 31, 2022
Topic Modeling被引用 8
一句话总结

本文提出提示注入(Prompt Injection, PI),一种将固定提示直接嵌入语言模型参数的方法,从而在推理时无需再附加提示。通过使用基于蒸馏的技术(如伪输入生成,Pseudo-INput Generation, PING),PI 相较于基线方法将 FLOPs 降低高达 280 倍,尤其在处理长提示(如详细人物设定或数据库模式)时效果显著。

ABSTRACT

Recent works have shown that attaching prompts to the input is effective at conditioning Language Models (LM) to perform specific tasks. However, prompts are always included in the input text during inference, thus incurring substantial computational and memory overhead. Also, there is currently no straightforward method of utilizing prompts that are longer than the maximum input length of the LMs without incurring additional costs during inference. We propose Prompt Injection (PI), a novel formulation of injecting the prompt into the parameters of an LM to be an efficient alternative to attaching fixed prompts to the input. We show that in scenarios with long fixed prompts, PI can be up to 280 times more efficient in terms of total FLOPs than previous approaches. We further explore methodologies for PI and show promising results in persona-dependent conversation, semantic parsing, and zero-shot learning with task instructions. Through these explorations, we show that PI can be a promising direction for conditioning language models, especially in scenarios with long and fixed prompts.

研究动机与目标

  • 解决在大型语言模型推理过程中反复将固定提示附加到输入序列所带来的计算与内存开销问题。
  • 克服基于 Transformer 的模型在处理长提示(如详细人物设定或数据库模式)时固定输入长度的限制。
  • 通过将提示直接注入模型参数,开发一种替代输入提示的高效方法,以实现更快的推理速度。
  • 探索有效的提示注入方法,包括持续预训练和一种新颖的蒸馏方法(PING),以最小化性能下降。
  • 在现实世界场景中展示提示注入的可行性与效率,例如将长达 13,000 个 token 的维基百科文章注入对话模型中。

提出的方法

  • 提出一种新颖的公式化方法——提示注入(PI),将固定提示注入预训练语言模型的参数中,从而在推理时无需将提示包含在输入序列中。
  • 采用一种名为伪输入生成(Pseudo-INput Generation, PING)的基于蒸馏的方法,其中模型在提示条件下的生成伪输入,并通过微调使其行为与显式附加提示的模型保持一致。
  • 将持续预训练作为基线方法,即在合成数据上微调模型,其中提示被附加到输入序列中。
  • 使用提示条件生成与知识蒸馏相结合的方式训练 PI 模型,使其输出分布与显式附加提示的模型保持一致。
  • 在多种任务上评估 PI:基于人物的对话、语义解析和零样本学习任务,与无约束(提示在输入中)和基线(无提示)模型进行对比。
  • 通过 PING 将长提示(如完整维基百科文章,13,000+ 个 token)注入 T5-large 模型,展示了在真实场景中应用的可行性与效率。

实验结果

研究问题

  • RQ1与传统的基于输入的提示方法相比,将提示注入模型参数是否能显著降低推理 FLOPs,尤其是在处理长提示时?
  • RQ2不同 PI 方法(如持续预训练与 PING)在消除输入提示开销的同时,对下游任务性能的保持效果如何?
  • RQ3PI 在不造成性能下降的前提下,能够处理多长的固定提示(如详细人物设定或整本维基百科文章)?
  • RQ4PI 与上界(即显式将提示置于输入中)之间的性能差距受哪些因素影响?输入的复杂度与结构如何影响这一差距?
  • RQ5PI 是否能在多种自然语言处理任务中有效应用,包括基于人物的对话、语义解析和零样本指令微调?

主要发现

  • 提示注入(PI)在处理长提示时,与基线方法(如 Fusion-in-Decoder 和 Linear Transformer)相比,总 FLOPs 最多降低 280 倍。
  • 伪输入生成(PING)方法的性能接近上界(即显式将提示置于输入中),优于持续预训练方法,并在 WSC 和 PERSONA-CHAT 等任务中接近无约束模型的性能。
  • 在基于人物的对话任务中,PING 实现了与上界几乎相当的性能,证明了对长人物设定描述的有效注入。
  • 对于 COPA 和 RTE 等复杂输入结构,PING 表现较差,原因在于伪输入生成质量较低,表明其对输入复杂度较为敏感。
  • 持续预训练基线(CP)相比无提示略有提升,但采用课程学习的持续预训练(CP w/ curr)在某些情况下性能进一步提升,甚至在 RTE 任务中超过上界。
  • 一个真实世界案例成功展示了通过 PING 将长达 13,000 个 token 的维基百科文章(埃隆·马斯克)注入 T5-large 模型,实现了无输入提示开销的准确人物化响应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。