Skip to main content
QUICK REVIEW

[论文解读] Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation

Yucheng Li|arXiv (Cornell University)|Sep 19, 2023
Topic Modeling被引用 4
一句话总结

本文提出一种基于困惑度的方法,无需访问训练数据即可估计语言模型基准测试中的数据污染情况。通过将测试集的困惑度与来自相同源分布的 memorised(记忆化)基线和 clean(纯净)基线进行比较,该方法检测出在阅读理解与摘要任务基准中存在显著的记忆化现象,尤其是在大模型中更为明显;而在多项选择数据集(如 MMLU)中则发现污染程度极低。

ABSTRACT

Data contamination in model evaluation is getting increasingly prevalent as the massive training corpora of large language models often unintentionally include benchmark samples. Therefore, contamination analysis has became an inevitable part of reliable model evaluation. However, existing method of contamination analysis requires the access of the entire training data which is often confidential for recent models. This prevent the community to rigorously audit these models and conduct accurate assessment of their capability. In this paper, we propose a novel method to quantify contamination without the access of the full training set, that measure the extent of contamination with perplexity. Our analysis provides evidence of significant memorisation of recent foundation models in popular reading comprehension, summarisation benchmarks, while multiple choice appears less contaminated.

研究动机与目标

  • 为解决由于训练数据不可用,导致对闭源模型及微调模型缺乏可靠的污染分析问题。
  • 开发一种方法,可在不完全访问训练语料库的前提下量化评估基准中的记忆化程度。
  • 通过提供一种可扩展、易访问的替代方案,取代 n-gram 重叠分析,实现社区范围内的模型能力审计。
  • 利用基于模型似然性的代理指标,评估主要 NLP 基准测试中数据污染的程度。

提出的方法

  • 该方法将测试集的困惑度与两个基线进行比较:一个来自训练数据(记忆化基线),另一个来自未在训练集中出现的数据(纯净基线)。
  • 基线构建基于与测试集相同的源分布数据——例如,阅读理解任务使用维基百科,摘要任务使用 BBC 新闻——以确保格式与长度的一致性。
  • 对于每个基准测试,测量模型在测试集上的困惑度,并与记忆化基线和纯净基线的平均困惑度进行比较。
  • 若测试集的困惑度更接近记忆化基线,则表明存在显著的记忆化与数据污染。
  • 该方法采用表述化技术,统一格式输入以确保困惑度计算的一致性,尤其适用于多项选择题。
  • 该方法通过直接测量模型似然性(即困惑度)避免了昂贵的 n-gram 重叠计算。

实验结果

研究问题

  • RQ1在无法访问训练数据的情况下,主流阅读理解基准测试在大语言模型中存在多大程度的污染?
  • RQ2测试集与基线之间的困惑度差异是否能可靠地指示记忆化与数据污染?
  • RQ3不同类型的基准测试——如阅读理解、摘要任务和多项选择题——中污染程度有何差异?
  • RQ4在无法访问训练数据的情况下,较小的模型是否比更大的模型更不容易发生记忆化?

主要发现

  • 所有测试的基础模型——gpt-3、llama-7b、13b 和 30b——在阅读理解基准测试(如 QuAC、BoolQ 和 SQuAD_v2)中均表现出显著的记忆化现象,其困惑度值更接近记忆化基线。
  • LLaMA-30B 模型表现出尤为强烈的记忆化现象,其在 SQuAD 上的困惑度甚至低于其自身的记忆化基线。
  • 摘要类基准测试(如 XSum)也显示出明显的污染迹象,所有模型的困惑度值均接近记忆化基线。
  • 相比之下,多项选择类基准测试(如 MMLU)未表现出明显的污染趋势,其困惑度值与数据创建时间无明显相关性,表明记忆化程度极低。
  • 较小的模型(如 LLaMA-7B)相比更大的模型记忆化程度较低,但在阅读理解任务中仍表现出可测量的污染。
  • 该方法成功识别出基准测试中的污染情况,且无需访问训练数据,从而实现了对闭源模型与微调模型的可信评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。