Skip to main content
QUICK REVIEW

[论文解读] On the Relation between Sensitivity and Accuracy in In-context Learning

Yanda Chen, Chen Zhao|arXiv (Cornell University)|Sep 16, 2022
Machine Learning and Data Classification被引用 6
一句话总结

本文指出,由于标签偏差的存在,上下文学习(ICL)模型对提示扰动的敏感性远超以往认知,且发现敏感性与准确率之间存在强烈负相关。为提升可靠性,作者提出SenSel,一种基于选择性预测的方法,可避免高敏感性预测,其在十个数据集上的表现优于基于置信度和熵的基线方法,AUC最高提升达+4.1个百分点。

ABSTRACT

In-context learning (ICL) suffers from oversensitivity to the prompt, making it unreliable in real-world scenarios. We study the sensitivity of ICL with respect to multiple perturbation types. First, we find that label bias obscures the true sensitivity, and therefore prior work may have significantly underestimated ICL sensitivity. Second, we observe a strong negative correlation between ICL sensitivity and accuracy: predictions sensitive to perturbations are less likely to be correct. Motivated by these findings, we propose extsc{SenSel}, a few-shot selective prediction method that abstains from sensitive predictions. Experiments on ten classification datasets show that extsc{SenSel} consistently outperforms two commonly used confidence-based and entropy-based baselines on abstention decisions.

研究动机与目标

  • 调查上下文学习(ICL)模型对提示扰动的真实敏感性,此前研究可能因标签偏差而低估了该敏感性。
  • 考察ICL预测敏感性与准确率之间的关系,特别是敏感预测是否更可能出错。
  • 开发一种选择性预测方法,利用敏感性作为信号,避免不可靠预测,从而提升高风险应用场景中的可信度。
  • 在无需额外标注数据的少样本设置下,评估SenSel与现有的基于置信度和熵的舍弃方法的性能。

提出的方法

  • 作者通过指令重述、噪声注入和上下文示例重排等方式扰动提示,计算输出变化来衡量ICL敏感性。
  • 采用提示校准(PC)方法校正标签偏差,调整模型概率以消除对特定标签的固有偏好。
  • SenSel基于对提示扰动的高敏感性选择样本进行舍弃,当模型输出在小幅度提示变化下发生显著改变时,避免做出预测。
  • 该方法通过设定敏感性分数阈值来决定是否舍弃预测,无需微调或引入额外模型。
  • 在GPT-J-6B和GPT-Neo-2.7B模型上,基于十个分类数据集评估该方法,并与MaxProb和Entropy基线进行比较。
  • 使用Coverage-F1曲线和AUC分数评估舍弃性能,结果在多种少样本shot设置和扰动类型下报告。

实验结果

研究问题

  • RQ1标签偏差如何掩盖上下文学习模型的真实敏感性,且先前的敏感性估计低估程度如何?
  • RQ2ICL预测敏感性与预测准确率之间是否存在可测量的相关性?若存在,其强度和方向如何?
  • RQ3对提示扰动的敏感性能否作为少样本学习中选择性预测的可靠信号?
  • RQ4在AUC和Coverage-F1性能方面,SenSel与基于置信度(MaxProb)和熵的舍弃方法相比表现如何?
  • RQ5在高敏感性任务中,基于敏感性的舍弃与基于概率的舍弃是否具有互补性?

主要发现

  • 标签偏差显著低估了ICL敏感性;经校正后,调整后的敏感性最高可达原始敏感性的2.8倍。
  • ICL敏感性与准确率之间存在强烈负相关,皮尔逊相关系数最低达-0.40。
  • SenSel在选择性预测性能上始终优于MaxProb和Entropy基线,AUC最高提升达+4.1个百分点。
  • SenSel在高敏感性任务中尤为有效,而MaxProb因过度依赖敏感的模型概率而失效。
  • SenSel与MaxProb具有互补性:SenSel在高敏感性任务中表现更优,而MaxProb在低敏感性任务中表现更佳。
  • 在Coverage-F1曲线中,SenSel在所有F1阈值下均实现更高的覆盖率,表明其在不同舍弃权衡下均表现稳健。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。