Skip to main content
QUICK REVIEW

[论文解读] Investigating Data Contamination for Pre-training Language Models

Minhao Jiang, Ken Ziyu Liu|arXiv (Cornell University)|Jan 11, 2024
Topic Modeling被引用 4
一句话总结

本文通过从零开始训练GPT-2模型并使用故意污染的语料库,研究了预训练语言模型中的数据污染问题,发现输入文本和真实答案的污染均显著提升了下游性能。研究揭示,当前大语言模型报告中使用的基于n-gram的污染定义方法存在不足,且重复污染会进一步放大性能增益,从而挑战了模型对污染具有鲁棒性的说法。

ABSTRACT

Language models pre-trained on web-scale corpora demonstrate impressive capabilities on diverse downstream tasks. However, there is increasing concern whether such capabilities might arise from evaluation datasets being included in the pre-training corpus -- a phenomenon known as extit{data contamination} -- in a manner that artificially increases performance. There has been little understanding of how this potential contamination might influence LMs' performance on downstream tasks. In this paper, we explore the impact of data contamination at the pre-training stage by pre-training a series of GPT-2 models extit{from scratch}. We highlight the effect of both text contamination ( extit{i.e.}\ input text of the evaluation samples) and ground-truth contamination ( extit{i.e.}\ the prompts asked on the input and the desired outputs) from evaluation data. We also investigate the effects of repeating contamination for various downstream tasks. Additionally, we examine the prevailing n-gram-based definitions of contamination within current LLM reports, pinpointing their limitations and inadequacy. Our findings offer new insights into data contamination's effects on language model capabilities and underscore the need for independent, comprehensive contamination assessments in LLM studies.

研究动机与目标

  • 在预训练阶段而非评估阶段事后分析数据污染对预训练语言模型的影响。
  • 考察输入文本和真实答案污染(提示和答案)对下游任务模型性能的影响。
  • 评估不同模型规模下重复污染对模型性能的影响。
  • 批判性评估近期大语言模型报告中使用的基于n-gram的污染定义的有效性。
  • 基于评估阶段的污染分析挑战大语言模型的鲁棒性声明,此类分析可能掩盖了真实预训练阶段的污染效应。

提出的方法

  • 使用故意污染了评估数据集输入和真实答案对的语料库,从零开始预训练多个GPT-2-small和GPT-2-large模型。
  • 系统性地以不同形式将评估数据注入预训练语料库:仅输入、输入+提示、输入+答案,以及完整输入+提示+答案污染。
  • 通过多次重复注入相同评估样本,研究其在预训练语料库中重复注入对下游性能的影响。
  • 应用近期大语言模型报告中使用的基于n-gram的污染定义方法对训练数据进行过滤,并重新训练模型以评估其有效性。
  • 在标准自然语言处理基准上评估模型,比较不同污染条件下及过滤后语料库的性能表现。
  • 结合零样本和少样本评估协议,评估模型在多样化下游任务中的行为表现。

实验结果

研究问题

  • RQ1RQ1:在预训练过程中,输入文本和真实答案的不同污染形式如何影响语言模型的性能?
  • RQ2RQ2:预训练语料库中污染数据的重复注入如何影响下游模型性能?
  • RQ3RQ3:近期大语言模型报告中使用的基于n-gram的污染定义方法,在检测预训练语料库中真实污染方面有多有效?
  • RQ4RQ4:现有基于评估阶段的污染分析在多大程度上能准确反映模型对污染的鲁棒性?

主要发现

  • 真实答案污染(包括提示和答案)带来的下游性能提升显著高于仅输入文本污染,表明模型行为更易受记忆化监督信号的影响。
  • 在预训练语料库中重复注入相同评估样本会导致下游性能单调上升,且性能增益在多次注入后依然持续存在。
  • 近期大语言模型报告中使用的基于n-gram的污染定义方法无法检测到许多真实污染情况,尤其当评估数据被改写或结构化修改时,这削弱了鲁棒性声明的有效性。
  • 即使使用基于n-gram的定义对语料库进行过滤后训练的模型,仍能在污染基准上表现出高性能,表明此类过滤方法无法可靠地去除污染,导致对模型鲁棒性的高估。
  • 基于评估阶段的污染分析——即单独在污染和非污染数据块上测试模型——无法准确反映预训练阶段的污染效应,因为性能差异被模型的归纳偏置所掩盖。
  • 本研究揭示,当前的污染检测与鲁棒性评估方法存在不足,凸显了对更精确、语义感知的定义与检测机制的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。