Skip to main content
QUICK REVIEW

[论文解读] Structured Prompting: Scaling In-Context Learning to 1,000 Examples

Yaru Hao, Yutao Sun|arXiv (Cornell University)|Dec 13, 2022
Topic Modeling被引用 11
一句话总结

本文提出结构化提示(structured prompting),通过分组演示、使用右对齐位置嵌入独立编码,并采用重缩放注意力机制,将上下文学习的示例数量扩展至1,000个。该方法将计算复杂度从二次方降低至线性,显著提升了传统上下文学习的性能与稳定性。

ABSTRACT

Large language models have exhibited intriguing in-context learning capability, achieving promising zero- and few-shot performance without updating the parameters. However, conventional in-context learning is usually restricted by length constraints, rendering it ineffective to absorb supervision from a large number of examples. In order to go beyond few shots, we introduce structured prompting that breaks the length limit and scales in-context learning to thousands of examples. Specifically, demonstration examples are separately encoded with well-designed position embeddings, and then they are jointly attended by the test example using a rescaled attention mechanism. So we can scale the number of exemplars with linear complexity instead of quadratic complexity with respect to length. Experimental results on a diverse set of tasks show that our approach improves end-task performance and reduces evaluation variance over conventional in-context learning as the number of demonstration examples increases. Code has been released at https://aka.ms/structured-prompting.

研究动机与目标

  • 为克服传统上下文学习在长度和计算上的限制,后者通常因上下文窗口大小和二次方注意力复杂度,将示例限制在5–100个之间。
  • 通过将演示示例数量扩展至少样本设定之外,提升上下文学习的稳定性和性能。
  • 在无需参数更新或微调的前提下,实现对大量示例的高效线性复杂度注意力机制。
  • 减少因示例顺序和排列变化导致的性能波动,提升少样本上下文学习的稳定性。

提出的方法

  • 将N个演示示例划分为M组,每组使用仅解码器的Transformer独立编码,采用右对齐位置嵌入以保持与测试输入之间一致的相对距离。
  • 仅缓存每组的自注意力机制中的键(key)和值(value)向量,以在推理阶段实现高效检索。
  • 采用重缩放注意力机制,对测试输入与分组示例之间的注意力分数进行归一化,以平衡上下文与输入的贡献。
  • 将编码后的组表示与测试输入拼接,并通过Transformer解码器进行自回归生成。
  • 应用不同的对齐策略(如截断、注意力掩码或填充空间)以对齐分组提示与测试输入,其中在BLOOM上截断策略表现最佳。
  • 使用固定模板将输入-输出对转换为语义上有意义的演示示例,再进行分组。

实验结果

研究问题

  • RQ1是否可以在不进行参数更新或微调的前提下,将上下文学习有效扩展至数千个示例?
  • RQ2在处理大量演示示例时,如何将注意力复杂度从二次方降低至线性?
  • RQ3增加示例数量是否能同时提升上下文学习的性能与稳定性?
  • RQ4在分组多个示例时,哪种对齐策略(如截断、注意力掩码)最能保持模型性能?
  • RQ5在多种自然语言处理任务中,结构化提示与传统上下文学习相比,在性能方差与准确率方面表现如何?

主要发现

  • 结构化提示在多个自然语言处理任务(包括文本分类、多选题和开放式生成)中达到最先进性能,优于传统上下文学习方法。
  • 在BLOOM-7B模型上,采用“截断”策略的结构化提示在任务上的平均准确率达到72.5%,高于未使用右对齐的70.9%。
  • 该方法有效降低了因示例排列顺序变化导致的性能波动,且随着示例数量增加,性能提升保持一致。
  • 在FairseqLM-6.7B模型上,结构化提示实现了75.6%的平均准确率,表明其在不同模型规模下均具备鲁棒性。
  • “截断”策略始终优于其他对齐方法,尤其在BLOOM上表现更优,表明其最有效地保持了注意力平衡。
  • 该方法可有效利用高达1,000个示例进行上下文学习,显著超过标准上下文学习通常限制的5–100个示例。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。