Skip to main content
QUICK REVIEW

[论文解读] Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks

Alon Jacovi, Avi Caciularu|arXiv (Cornell University)|May 17, 2023
Data Quality and Management被引用 5
一句话总结

本文提出了三种实用策略,以缓解自然语言处理(NLP)评估中的数据污染问题:使用公钥加密技术对测试数据进行加密并配合非衍生作品许可协议,拒绝评估未提供训练数据排除保证的封闭API模型,以及避免使用已公开发布的数据及其解决方案。这些措施旨在假设所有参与者均为善意的前提下,维护评估的完整性,为来自网络爬取语料库和基于API的模型的污染提供切实可行的防御手段。

ABSTRACT

Data contamination has become prevalent and challenging with the rise of models pretrained on large automatically-crawled corpora. For closed models, the training data becomes a trade secret, and even for open models, it is not trivial to detect contamination. Strategies such as leaderboards with hidden answers, or using test data which is guaranteed to be unseen, are expensive and become fragile with time. Assuming that all relevant actors value clean test data and will cooperate to mitigate data contamination, what can be done? We propose three strategies that can make a difference: (1) Test data made public should be encrypted with a public key and licensed to disallow derivative distribution; (2) demand training exclusion controls from closed API holders, and protect your test data by refusing to evaluate without them; (3) avoid data which appears with its solution on the internet, and release the web-page context of internet-derived data along with the data. These strategies are practical and can be effective in preventing data contamination.

研究动机与目标

  • 解决由于模型在互联网爬取语料库上进行训练,或通过API调用导致的NLP基准测试中日益严重的数据污染问题。
  • 缓解在训练数据不透明且可能包含评估数据的封闭模型中,数据污染带来的风险。
  • 为研究人员提出可操作、实用的策略,以维护评估数据的完整性。
  • 在假设所有参与者均为善意、希望避免污染的前提下运作,重点聚焦于技术与程序性防护措施。
  • 为研究人员提供一个框架,用以评估并降低测试数据中的污染风险,尤其针对开放模型和封闭模型。

提出的方法

  • 使用公钥密码学对公开的测试数据进行加密,以防止自动爬取和未经授权的分发。
  • 利用明确禁止衍生作品的软件许可证,从法律上限制对修改后或提取出的数据的再分发。
  • 拒绝使用未提供训练数据排除保证的封闭API模型,从而保护测试数据不被用于未来模型的训练。
  • 避免使用在互联网上已发布解决方案的评估数据;当使用互联网来源的数据时,应发布网页上下文信息,以支持溯源追踪。
  • 倡导建立一个研究数据库,用于记录污染事件,并促进模型训练数据来源的透明化。
  • 探索对元数据或非侵入性数据组件进行水印标记的技术,以检测污染,尽管该方法在测试数据中仍处于研究初期。

实验结果

研究问题

  • RQ1研究人员在使用公开可用或由API托管的模型时,如何防止测试数据被无意中包含在模型训练中?
  • RQ2在不依赖信任的前提下,有哪些实用且可强制执行的机制可用于防止评估基准中的数据污染?
  • RQ3加密与许可策略在多大程度上能有效防止公开测试集中的数据泄露至模型训练数据中?
  • RQ4研究人员如何确保发送至封闭API的评估数据不会成为未来模型训练的一部分?
  • RQ5元数据、溯源信息以及上下文信息的发布,在多大程度上能降低来自互联网来源数据集的污染风险?

主要发现

  • 本文表明,数据污染是NLP评估有效性的关键威胁,尤其是在模型基于互联网爬取语料库训练,或在未提供排除保证的情况下将测试数据发送至封闭API时。
  • 若未加密或未施加限制性许可协议,公开的测试数据容易遭受自动爬取,并可能被纳入模型训练,即使未被直接使用。
  • 使用公钥加密结合非衍生作品许可协议,可有效防止测试数据的未经授权分发和衍生使用。
  • 拒绝评估未提供训练数据排除保证的封闭API模型,是一种切实可行且有效的策略,可防止评估数据被污染。
  • 发布互联网来源数据的网页上下文信息,可提升溯源追踪能力,并降低意外污染的风险。
  • 这些策略在假设参与者均为善意的前提下最为有效;然而,若在数据处理中存在疏忽或恶意行为,即便采取这些措施,数据完整性仍可能被破坏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。