Skip to main content
QUICK REVIEW

[论文解读] In-context Example Selection with Influences

Tai D. Nguyen, Eric Wong|arXiv (Cornell University)|Feb 21, 2023
Topic Modeling被引用 4
一句话总结

本文提出了一种上下文内影响(in-context influences)方法,用于量化单个上下文内示例对少样本语言模型性能的影响。通过利用基于微调的影响力估计方法,结合前向传播,该方法识别出高影响力(正面)和低影响力(负面)的示例,在9项SuperGLUE任务上表现优于基线方法,当选择影响力最高的示例而非最低时,性能最高提升达16.3%。

ABSTRACT

In-context learning (ICL) is a powerful paradigm emerged from large language models (LLMs). Despite its promises, ICL performance is known to be highly sensitive to input examples. In this work, we use $ extit{in-context influences}$ to analyze few-shot ICL performance directly from the in-context examples. Our proposed influence-based example selection method can identify both positive and negative examples, outperforming several baselines when evaluated on 9 SuperGLUE tasks. Our analysis uncovers up to a $16.3\%$ performance gap between using the most negative in-context examples compared to the most positive. In a case study, we apply our influence-based framework to quantify the phenomena of recency bias in example ordering for few-shot ICL.

研究动机与目标

  • 理解并量化单个上下文内示例对少样本上下文学习(ICL)性能的影响。
  • 开发一种可扩展的离线方法,基于示例对模型预测的影响选择最优的上下文内示例。
  • 分析由于示例选择和排序导致的ICL性能变化,特别是已知偏差(如最近效应和多数偏差)的影响。
  • 将影响力框架推广至分类以外的其他NLP任务和模型族。

提出的方法

  • 该方法采用一种适配于ICL的基于微调的影响力框架,其中‘训练’通过在包含部分上下文示例的提示上进行前向传播来模拟。
  • 通过构建包含k-shot提示的数据集,使用不同示例子集并测量其验证性能,以估计影响力。
  • 通过在开发集示例上学习从子集性能到单个示例贡献的线性映射,计算影响力分数。
  • 该框架可推广至任意性能度量,并可应用于分析位置效应(如最近效应),通过分析不同示例排序下的影响力。
  • 该方法利用对LLM的查询访问,避免了梯度计算,因此相比标准影响力方法计算效率更高。
Figure 1: Test accuracy increases when examples are selected in increasing in-context influence percentile bins.
Figure 1: Test accuracy increases when examples are selected in increasing in-context influence percentile bins.

实验结果

研究问题

  • RQ1单个上下文内示例如何影响少样本ICL性能?我们能否量化其正面或负面影响?
  • RQ2基于影响力的示例选择能否在选择有效上下文示例方面优于现有基线方法(如语义相似度或困惑度)?
  • RQ3在ICL中,最具影响力和最无影响力示例之间的性能差异有多大?
  • RQ4示例排序如何影响ICL性能?影响力分析能否量化最近效应?
  • RQ5上下文内影响力在多大程度上与已知信号(如示例困惑度或嵌入相似度)相关?

主要发现

  • 在9项SuperGLUE任务中,基于影响力的示例选择在正样本和负样本选择方面均优于多个基线方法。
  • 在LLaMA-13B上,最具正面影响和最具负面影响的示例之间性能差距最高可达16.3%,表明示例影响存在显著差异。
  • 该框架成功量化了最近效应,表明后置示例影响力更高,尤其在较长的k-shot设置中更为明显。
  • 影响力分数与已知信号(如示例困惑度或嵌入相似度)的相关性较低,表明其捕捉到了一种独特且具有信息量的信号。
  • 该方法在多个模型族和任务上具有泛化能力,包括多选和二分类任务,且在多选任务中观察到更强的性能提升。
Figure 2: Token budget comparison for different baselines evaluated on LLaMA-7B ( $|S|=400$ ).
Figure 2: Token budget comparison for different baselines evaluated on LLaMA-7B ( $|S|=400$ ).

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。