Skip to main content
QUICK REVIEW

[论文解读] Task Contamination: Language Models May Not Be Few-Shot Anymore

Changmao Li, Jeffrey Flanigan|arXiv (Cornell University)|Dec 26, 2023
Topic Modeling被引用 6
一句话总结

本文研究了大语言模型(LLMs)中的任务污染问题,表明零样本和少样本性能的提升通常源于预训练期间接触到任务示例,而非真正的少样本泛化能力。通过时间顺序的数据集评估、训练数据检查、示例提取以及成员身份推断,作者发现模型在预训练时期的数据集上表现显著更优,且可提取的训练示例数量与性能提升之间存在强烈相关性——尤其在GPT-3系列模型中表现明显。

ABSTRACT

Large language models (LLMs) offer impressive performance in various zero-shot and few-shot tasks. However, their success in zero-shot and few-shot settings may be affected by task contamination, a potential limitation that has not been thoroughly examined. This paper investigates how zero-shot and few-shot performance of LLMs has changed chronologically over time. Utilizing GPT-3 series models and several other recent open-sourced LLMs, and controlling for dataset difficulty, we find that on datasets released before the LLM training data creation date, LLMs perform surprisingly better than on datasets released after. This strongly indicates that, for many LLMs, there exists task contamination on zero-shot and few-shot evaluation for datasets released prior to the LLMs' training data creation date. Additionally, we utilize training data inspection, task example extraction, and a membership inference attack, which reveal further evidence of task contamination. Importantly, we find that for classification tasks with no possibility of task contamination, LLMs rarely demonstrate statistically significant improvements over simple majority baselines, in both zero and few-shot settings.

研究动机与目标

  • 调查大语言模型在零样本和少样本设置下表现强劲的原因是否源于预训练数据中的任务污染。
  • 系统分析数据集发布时间与大语言模型预训练数据收集时间之间的时序影响。
  • 通过多种方法(训练数据检查、任务示例提取、成员身份推断攻击)提供任务污染的实证证据。
  • 评估大语言模型在少样本设置下是否真正具备泛化能力,还是仅在回忆预训练中的示例。
  • 倡导提高模型训练数据的透明度,并警示因污染导致对少样本能力的过度估计。

提出的方法

  • 在17项任务上对12个大语言模型(包括GPT-3系列和开源模型)进行时间顺序评估,比较其在模型预训练数据收集日期之前和之后发布数据集上的表现。
  • 检查训练数据,以在预训练语料库中搜索是否存在完全匹配或近似重复的任务示例。
  • 从指令微调的大语言模型中提取任务示例,以确定训练示例是否被记忆并可检索。
  • 对Spider语义解析任务实施成员身份推断攻击,以检验模型预测是否与预训练数据中存在训练示例相关。
  • 对性能提升相对于多数基线的统计分析,显著性水平设定为99%。
  • 分析可提取训练示例数量与模型在下游任务上准确率之间的相关性。
(a) GPT-3 series on pre-collection datasets
(a) GPT-3 series on pre-collection datasets

实验结果

研究问题

  • RQ1预训练数据中的任务污染在多大程度上解释了大语言模型在零样本和少样本设置下表现优异的原因?
  • RQ2大语言模型在预训练数据收集日期之前和之后发布数据集上的表现有何差异?
  • RQ3能否从指令微调的大语言模型中提取出任务示例?可提取示例的数量是否与模型性能相关?
  • RQ4对于不可能存在任务污染的分类任务,大语言模型在零样本或少样本设置下是否能表现出相对于简单多数基线的统计显著提升?
  • RQ5可提取训练示例的数量与模型在下游任务上的准确率之间是否存在可测量的关联?

主要发现

  • 大语言模型在预训练数据收集日期之前发布的数据集上表现显著优于之后发布的数据集,表明存在任务污染。
  • 对于不可能存在任务污染的分类任务,大语言模型在零样本或少样本设置下很少能相对于简单多数基线表现出统计显著的性能提升。
  • 在Spider语义解析任务上,可提取训练示例数量与模型准确率之间存在强烈相关性(R = .88)。
  • 从davinci到GPT-3.5-turbo,GPT-3系列模型中可提取的训练示例数量持续增加,其增长趋势与零样本性能在相同任务上的提升高度一致。
  • 训练数据检查与示例提取在多个模型中提供了任务污染的一致证据,涵盖闭源的GPT-3以及开源模型如LLaMA和Vicuna。
  • 成员身份推断攻击证实,模型在某些任务上的表现强烈受预训练中对任务示例暴露的影响,而非其泛化能力。
(b) GPT-3 series on post-collection datasets
(b) GPT-3 series on post-collection datasets

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。