[论文解读] The MiniPile Challenge for Data-Efficient Language Models
该论文提出了MiniPile,一个6GB、经过筛选的The Pile子集,包含100万篇文档,旨在使学术预算有限的研究人员能够实现数据高效的语言模型预训练。通过三步流程——使用E5-Large模型进行嵌入推理、k均值聚类,以及人工指导的低质量聚类过滤——在使用BERT和T5模型进行预训练时,与在2.6倍至745倍更多数据上训练的模型相比,GLUE和SNI基准上的性能仅分别下降1.9%和2.5%。
The ever-growing diversity of pre-training text corpora has equipped language models with generalization capabilities across various downstream tasks. However, such diverse datasets are often too large for academic budgets; hence, most research on Transformer architectures, training procedures, optimizers, etc. gets conducted on smaller, homogeneous datasets. To this end, we present The MiniPile Challenge, where one pre-trains a language model on a diverse text corpus containing at most 1M documents. MiniPile is a 6GB subset of the deduplicated 825GB The Pile corpus. To curate MiniPile, we perform a simple, three-step data filtering process: we (1) infer embeddings for all documents of the Pile, (2) cluster the embedding space using $k$-means, and (3) filter out low-quality clusters. To verify MiniPile's suitability for language model pre-training, we use it to pre-train a BERT and T5 model, yielding a performance drop of only $1.9\%$/$2.5\%$ on the GLUE and SNI benchmarks compared to the original pre-trained checkpoints trained on $2.6$x/$745$x the amount of data. MiniPile is available at https://huggingface.co/datasets/JeanKaddour/minipile.
研究动机与目标
- 通过使计算资源有限的研究人员能够基于多样化、高质量语料库训练模型,弥合数据高效预训练的差距。
- 减少对WikiText103或enwik8等小规模、同质化数据集的依赖,这些数据集限制了模型的泛化能力。
- 创建一个可扩展、经过筛选的The Pile替代品,在保持多样性的同时过滤掉低质量和有害内容。
- 证明100万篇文档的子集可实现强大的下游性能,与全规模预训练相比准确率下降极小。
- 提供一个可复现、公开可用的基准数据集,用于评估数据高效训练方法。
提出的方法
- 使用E5-Large句子嵌入模型对去重后的825GB The Pile中所有文档提取密集嵌入。
- 在归一化嵌入上使用余弦距离对批量k均值聚类进行处理,设定k=220个聚类(每个The Pile子数据集10个)。
- 通过评估文档与聚类中心的距离,并由人工标注者评估代表性样本(5个最近、5个最远)来过滤聚类。
- 基于内容(如近似重复、色情内容或导航栏)将低质量聚类排除。
- 在过滤后的MiniPile子集上对BERT-Base和T5-Base模型进行预训练,以评估下游性能。
- 将微调后模型在GLUE和SNI基准上的性能与在显著更大语料上预训练的原始模型进行比较。

实验结果
研究问题
- RQ1一个包含100万篇文档、6GB的The Pile子集,能否在下游性能上与在更大数据集上预训练的模型相媲美?
- RQ2基于聚类的文档嵌入过滤是否能有效去除低质量和有害内容,同时保留信息丰富的数据?
- RQ3MiniPile在多大程度上保持了The Pile的多样性,从而支持在多种NLP任务上的泛化能力?
- RQ4与在小规模、同质化数据集(如WikiText103)上预训练相比,MiniPile在下游性能方面表现如何?
- RQ5在聚类级别表示上引入人工干预的过滤步骤,是否能实现高质量、可扩展的数据集,而无需检查整个语料库?
主要发现
- 在MiniPile上预训练BERT-Base模型,在GLUE基准上的性能相比在16GB数据上预训练的原始BERT模型仅下降1.9%。
- 在MiniPile上预训练T5-Base模型,在SNI基准上的性能相比在745倍更多数据上预训练的原始T5模型仅下降2.5%。
- 尽管MiniPile仅包含6GB数据和100万篇文档,但其仍保持了足够的多样性和信息含量,支持强大的下游泛化能力。
- 基于中心点距离和代表性样本的人工引导聚类过滤,成功去除了有害和低质量内容,包括近似重复和明确内容。
- 在聚类内进行随机子采样优于仅选择距离中心最近的前l篇文档,表明仅去除异常值不足以实现最优预训练。
- MiniPile数据集已公开发布于huggingface.co/datasets/jeankaddour/minipile,支持数据高效NLP领域的可复现研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。