Skip to main content
QUICK REVIEW

[论文解读] Active Example Selection for In-Context Learning

Yiming Zhang, Feng Shi|arXiv (Cornell University)|Nov 8, 2022
Topic Modeling被引用 5
一句话总结

本文提出了一种基于强化学习的上下文学习主动示例选择方法,将示例选择建模为序列决策问题,以提升模型的泛化能力。该方法在未见过的任务上使 GPT-2 的平均准确率提升了 5.8%,在 GPT-3 Ada 上取得小幅提升,而在更大的 GPT-3 模型上收益递减,凸显了大模型中涌现能力的出现。

ABSTRACT

With a handful of demonstration examples, large-scale language models show strong capability to perform various tasks by in-context learning from these examples, without any fine-tuning. We demonstrate that in-context learning performance can be highly unstable across samples of examples, indicating the idiosyncrasies of how language models acquire information. We formulate example selection for in-context learning as a sequential decision problem, and propose a reinforcement learning algorithm for identifying generalizable policies to select demonstration examples. For GPT-2, our learned policies demonstrate strong abilities of generalizing to unseen tasks in training, with a $5.8\%$ improvement on average. Examples selected from our learned policies can even achieve a small improvement on GPT-3 Ada. However, the improvement diminishes on larger GPT-3 models, suggesting emerging capabilities of large language models.

研究动机与目标

  • 探究由于演示示例选择导致的上下文学习性能不稳定的根源。
  • 开发一种适用于多样化任务的可泛化有效演示示例选择策略。
  • 探索强化学习是否能够发现适用于低少样本上下文学习中主动示例选择的系统性、可迁移策略。
  • 比较 GPT-2 与更大规模 GPT-3 模型在示例选择下的行为差异,揭示其在涌现能力上的不同。
  • 为大语言模型如何在上下文中获取信息提供洞见,并为大规模模型时代的研究提供指导。

提出的方法

  • 使用强化学习将主动示例选择建模为序列决策问题。
  • 训练一个策略网络,从池中迭代选择未标记示例,基于预测的模型性能。
  • 在训练过程中使用基于验证集上上下文学习准确率的奖励信号。
  • 将训练好的策略应用于新任务或未标记样本池,评估零样本泛化能力。
  • 采用课程学习风格的训练设置,使策略从逐步复杂化的任务中学习。
  • 在 GPT-2 上使用 4-shot 上下文学习验证策略,并评估其在未见任务上的泛化能力。

实验结果

研究问题

  • RQ1不同演示示例集合下,上下文学习的性能如何变化,特别是在 GPT-2 上?
  • RQ2强化学习能否发现可泛化的策略,以提升多样化任务中上下文学习的性能?
  • RQ3有效演示示例的特性与人类直觉有何不同?
  • RQ4所学示例选择带来的性能增益在不同模型规模下如何变化,特别是在 GPT-2 与更大规模 GPT-3 模型之间?
  • RQ5在 GPT-2 上训练的策略在多大程度上可泛化到 GPT-3 模型?为何在更大模型上收益递减?

主要发现

  • GPT-2 的上下文学习性能在不同演示示例集合间表现出显著方差,表明其信息获取过程存在不稳定性。
  • 所提出的基于强化学习的主动示例选择策略,使 GPT-2 在未见任务上的上下文学习准确率平均提升 5.8%。
  • 在已知任务上,该策略相较于最大熵主动学习基线,在 GPT-2 上实现了 12.1% 的性能提升(基于有标签数据集)。
  • 由学习策略选出的示例在 GPT-3 Ada 上带来小但可测量的性能提升,表明所学选择策略具有可迁移性。
  • 在更大的 GPT-3 模型(如 Babbage 和 Curie)上,性能增益显著下降,表明模型的涌现能力使其对精心筛选示例的依赖降低。
  • 分析显示,有效演示示例往往与人类直觉相悖,提示有效上下文学习中存在非显而易见的模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。