[论文解读] Data Portraits: Recording Foundation Model Training Data
该论文提出了数据画像(Data Portraits)——一种基于分段布隆过滤器的轻量级、概率性数据结构——可实现对基础模型训练数据的快速、高效成员资格判断。通过仅存储原始数据集大小的3%,该方法使研究人员和用户能够判断给定文本片段是否属于训练语料库,从而以极低的误报率有效检测测试集泄露和模型抄袭问题。
Foundation models are trained on increasingly immense and opaque datasets. Even while these models are now key in AI system building, it can be difficult to answer the straightforward question: has the model already encountered a given example during training? We therefore propose a widespread adoption of Data Portraits: artifacts that record training data and allow for downstream inspection. First we outline the properties of such an artifact and discuss how existing solutions can be used to increase transparency. We then propose and implement a solution based on data sketching, stressing fast and space efficient querying. Using our tools, we document a popular language modeling corpus (The Pile) and a recently released code modeling dataset (The Stack). We show that our solution enables answering questions about test set leakage and model plagiarism. Our tool is lightweight and fast, costing only 3% of the dataset size in overhead. We release a live interface of our tools at https://dataportraits.org/ and call on dataset and model creators to release Data Portraits as a complement to current documentation practices.
研究动机与目标
- 为解决缺乏实用工具来判断某段文本是否属于基础模型训练数据的问题。
- 通过引入一种新型文档化成果——数据画像——提升人工智能模型开发的透明度,支持成员资格判断。
- 提供一种轻量、可扩展的数据集检查方案,与现有的文档实践(如数据表和模型卡)相辅相成。
- 使内容创作者、科研人员和终端用户能够检测大规模语言模型中的数据泄露、抄袭和记忆化现象。
- 倡导数据集和模型创建者广泛采用数据画作为标准实践。
提出的方法
- 该方法采用分段布隆过滤器——一种压缩的、概率性数据结构,通过使用多个哈希函数以空间高效的方式表示训练数据。
- 将每个文本样本分割为固定长度的n-gram(例如50个字符),然后对这些n-gram进行哈希并存储在布隆过滤器中,以支持快速成员资格查询。
- 系统支持毫秒级延迟的查询,存储开销仅为原始数据集大小的约3%。
- 在构建时可调节误报率,从而在准确性和存储成本之间实现权衡。
- 该方法避免了完整数据的重新分发,支持本地、离线的成员资格测试,且无需暴露原始数据集。
- 该实现已在The Pile和The Stack数据集上进行了演示,实时网页界面可访问dataportraits.org。
实验结果
研究问题
- RQ1是否可以使用轻量、高效的数结构来回答成员资格问题:该样本是否在训练数据中?
- RQ2像布隆过滤器这样的概率数据结构,在多大程度上能够支持对大规模网络爬取数据集的准确且可扩展的成员资格判断?
- RQ3在速度、准确性和资源使用方面,分段布隆过滤器与全文索引或grep方法相比表现如何?
- RQ4当应用于The Pile和The Stack等真实世界语言建模数据集时,此类系统的误报率是多少?
- RQ5在实际应用中,数据画像能否有效检测测试集泄露和模型抄袭?
主要发现
- 分段布隆过滤器实现每查询成员资格判断时间低于1毫秒,存储开销仅为原始数据集大小的3%。
- 系统报告的误报率为7×10⁻⁴,略低于预期的1×10⁻³,表明其在实际应用中具有较强的准确性。
- 与全文索引(如FTS)相比,布隆过滤器在200字符上下文下的速度快约700倍,但在短上下文下的召回率和精确率较低。
- 该方法成功检测到新输入与训练数据之间的重叠文本片段,包括长文本匹配如“National Counterintelligence and Security Center”。
- 该工具能够检测测试集泄露和模型抄袭,已在The Pile和The Stack数据集的案例研究中得到验证。
- 该系统支持近似成员资格测试和文档指纹识别,性能可通过误报率和n-gram长度参数进行调节。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。