[论文解读] Structured Prompting: Scaling In-Context Learning to 1,000 Examples
本文提出结构化提示(structured prompting),通过分组演示、使用右对齐位置嵌入独立编码,并采用重缩放注意力机制,将上下文学习的示例数量扩展至1,000个。该方法将计算复杂度从二次方降低至线性,显著提升了传统上下文学习的性能与稳定性。
Large language models have exhibited intriguing in-context learning capability, achieving promising zero- and few-shot performance without updating the parameters. However, conventional in-context learning is usually restricted by length constraints, rendering it ineffective to absorb supervision from a large number of examples. In order to go beyond few shots, we introduce structured prompting that breaks the length limit and scales in-context learning to thousands of examples. Specifically, demonstration examples are separately encoded with well-designed position embeddings, and then they are jointly attended by the test example using a rescaled attention mechanism. So we can scale the number of exemplars with linear complexity instead of quadratic complexity with respect to length. Experimental results on a diverse set of tasks show that our approach improves end-task performance and reduces evaluation variance over conventional in-context learning as the number of demonstration examples increases. Code has been released at https://aka.ms/structured-prompting.
研究动机与目标
- 为克服传统上下文学习在长度和计算上的限制,后者通常因上下文窗口大小和二次方注意力复杂度,将示例限制在5–100个之间。
- 通过将演示示例数量扩展至少样本设定之外,提升上下文学习的稳定性和性能。
- 在无需参数更新或微调的前提下,实现对大量示例的高效线性复杂度注意力机制。
- 减少因示例顺序和排列变化导致的性能波动,提升少样本上下文学习的稳定性。
提出的方法
- 将N个演示示例划分为M组,每组使用仅解码器的Transformer独立编码,采用右对齐位置嵌入以保持与测试输入之间一致的相对距离。
- 仅缓存每组的自注意力机制中的键(key)和值(value)向量,以在推理阶段实现高效检索。
- 采用重缩放注意力机制,对测试输入与分组示例之间的注意力分数进行归一化,以平衡上下文与输入的贡献。
- 将编码后的组表示与测试输入拼接,并通过Transformer解码器进行自回归生成。
- 应用不同的对齐策略(如截断、注意力掩码或填充空间)以对齐分组提示与测试输入,其中在BLOOM上截断策略表现最佳。
- 使用固定模板将输入-输出对转换为语义上有意义的演示示例,再进行分组。
实验结果
研究问题
- RQ1是否可以在不进行参数更新或微调的前提下,将上下文学习有效扩展至数千个示例?
- RQ2在处理大量演示示例时,如何将注意力复杂度从二次方降低至线性?
- RQ3增加示例数量是否能同时提升上下文学习的性能与稳定性?
- RQ4在分组多个示例时,哪种对齐策略(如截断、注意力掩码)最能保持模型性能?
- RQ5在多种自然语言处理任务中,结构化提示与传统上下文学习相比,在性能方差与准确率方面表现如何?
主要发现
- 结构化提示在多个自然语言处理任务(包括文本分类、多选题和开放式生成)中达到最先进性能,优于传统上下文学习方法。
- 在BLOOM-7B模型上,采用“截断”策略的结构化提示在任务上的平均准确率达到72.5%,高于未使用右对齐的70.9%。
- 该方法有效降低了因示例排列顺序变化导致的性能波动,且随着示例数量增加,性能提升保持一致。
- 在FairseqLM-6.7B模型上,结构化提示实现了75.6%的平均准确率,表明其在不同模型规模下均具备鲁棒性。
- “截断”策略始终优于其他对齐方法,尤其在BLOOM上表现更优,表明其最有效地保持了注意力平衡。
- 该方法可有效利用高达1,000个示例进行上下文学习,显著超过标准上下文学习通常限制的5–100个示例。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。