[论文解读] NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark
本文指出,NLP基准测试中的数据污染问题——即大型语言模型(LLMs)在训练过程中使用了测试数据——导致性能指标被夸大,科学结论无效。为此,本文提出建立一个由社区驱动的注册系统,用于检测、记录并标记污染案例,辅以自动化工具和会议层面的政策,以确保研究的完整性。
In this position paper, we argue that the classical evaluation on Natural Language Processing (NLP) tasks using annotated benchmarks is in trouble. The worst kind of data contamination happens when a Large Language Model (LLM) is trained on the test split of a benchmark, and then evaluated in the same benchmark. The extent of the problem is unknown, as it is not straightforward to measure. Contamination causes an overestimation of the performance of a contaminated model in a target benchmark and associated task with respect to their non-contaminated counterparts. The consequences can be very harmful, with wrong scientific conclusions being published while other correct ones are discarded. This position paper defines different levels of data contamination and argues for a community effort, including the development of automatic and semi-automatic measures to detect when data from a benchmark was exposed to a model, and suggestions for flagging papers with conclusions that are compromised by data contamination.
研究动机与目标
- 揭露由于大语言模型在训练过程中使用测试数据而引发的NLP基准测试中数据污染的严重风险。
- 证明数据污染会导致模型性能被高估,并引发无效的科学结论。
- 呼吁系统性地检测并记录大语言模型与基准测试中的污染案例。
- 倡导建立全社区范围的机制,包括自动化检测与会议层面的污染研究标记。
- 通过防止依赖在基准测试集上训练的模型,确保NLP评估的完整性。
提出的方法
- 提出一个多层级污染分类体系,以评估数据泄露的严重程度。
- 建立公开注册系统(如LM污染指数),用于记录已知的污染案例,包括大语言模型、基准测试及证据。
- 利用模型记忆特性,检测大语言模型是否能复现测试集中确切的基准实例。
- 采用基于提示的测试方法,触发大语言模型重新生成基准示例(如CoNLL-2003、GSM-8K)。
- 与会议合作,实施政策以标记或拒绝依赖污染模型的研究论文。
- 整合半自动与人工验证流程,以核实污染证据。
实验结果
研究问题
- RQ1主流NLP基准测试在多大程度上因大语言模型的预训练数据而受到污染?
- RQ2数据污染在多大程度上影响了NLP中模型性能评估的可靠性?
- RQ3可以开发哪些机制来检测并记录大语言模型与基准测试中的污染案例?
- RQ4NLP社区如何确保科学结论不会因模型数据泄露而被无效化?
- RQ5需要哪些制度性政策来防止基于污染模型的研究结果被发表?
主要发现
- ChatGPT、WizardCoder和GitHub Copilot能够完美复现CoNLL-2003测试集第一行的BIO格式内容,表明其直接记忆了基准数据。
- GPT-3、GPT-4及其他大语言模型已被证实其训练数据中包含了基准测试集的部分内容(如BIG-bench、GSM-8K、MATH)。
- 在污染基准上评估的模型性能被高估,导致比较结果具有误导性。
- 多篇已发表论文,包括一篇ACL 2023论文,曾基于CoNLL-2003对GPT-3和Codex进行评估,引发对其结论有效性的担忧。
- 已建立LM污染指数作为公开注册系统,用于追踪和记录污染案例。
- 若缺乏检测机制,污染风险将破坏科学严谨性,并导致无效研究结论的发表。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。