[论文解读] When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale
本文在大规模场景下研究了预训练大语言模型(LLMs)时的数据剪枝方法,提出基于困惑度的简单排序方法优于EL2N和记忆度等复杂指标。令人惊讶的是,仅使用原始数据集30%的样本(通过困惑度筛选)训练的模型,其性能比采用更复杂方法剪枝的模型最高提升了2.1%,表明在优先考虑数据质量而非数量时,更少的数据反而能取得更好的结果。
Large volumes of text data have contributed significantly to the development of large language models (LLMs) in recent years. This data is typically acquired by scraping the internet, leading to pretraining datasets comprised of noisy web text. To date, efforts to prune these datasets down to a higher quality subset have relied on hand-crafted heuristics encoded as rule-based filters. In this work, we take a wider view and explore scalable estimates of data quality that can be used to systematically measure the quality of pretraining data. We perform a rigorous comparison at scale of the simple data quality estimator of perplexity, as well as more sophisticated and computationally intensive estimates of the Error L2-Norm and memorization. These metrics are used to rank and prune pretraining corpora, and we subsequently compare LLMs trained on these pruned datasets. Surprisingly, we find that the simple technique of perplexity outperforms our more computationally expensive scoring methods. We improve over our no-pruning baseline while training on as little as 30% of the original training dataset. Our work sets the foundation for unexplored strategies in automatically curating high quality corpora and suggests the majority of pretraining data can be removed while retaining performance.
研究动机与目标
- 评估通过选择更高品质训练样本是否能提升大语言模型的性能。
- 比较困惑度、EL2N和记忆度等简单与复杂数据质量估计器在大语言模型预训练中的有效性。
- 探究从大规模网络爬取数据集中移除低影响样本是否能在减少数据量的同时提升模型性能。
- 建立一种可扩展的、自动化的高质量语料库整理框架,无需依赖人工标注的质量标签。
- 理解不同剪枝策略对不同模型规模、数据集和训练步数下模型泛化能力的影响。
提出的方法
- 作者使用一个参考大语言模型为预训练数据集中的每个序列计算困惑度、EL2N和记忆度得分。
- 根据这些得分对所有训练序列进行排序,并仅保留分布中顶部、中部或底部的百分比(10%、30%、50%、70%)。
- 在剪枝后的数据集上从头开始微调一个新的大语言模型,使用与基线模型相同的超参数。
- 该方法在多个模型规模(124M至1.5B参数)、多个预训练数据集以及不同总训练步数上进行了应用。
- 通过测试集困惑度和下游GLUE基准测试结果评估性能。
- 该框架支持在不同数据子集和模型配置下系统性地比较剪枝策略。

实验结果
研究问题
- RQ1与在完整数据集上训练相比,基于自动质量估计器的数据剪枝是否能提升大语言模型的性能?
- RQ2基于困惑度的简单剪枝方法是否优于EL2N和记忆度等计算更复杂、更耗时的指标?
- RQ3选择不同数据子集(高分、中分、低分)如何影响不同模型规模和训练数据量下的模型性能?
- RQ4剪枝是否能保持甚至增强在GLUE等基准测试中的下游泛化能力?
- RQ5在质量估计引导下,是否能实现显著的数据量减少(例如减少70%)并维持或提升模型性能?
主要发现
- 在所有模型规模和数据量下,基于困惑度的剪枝方法均优于基于EL2N和记忆度的剪枝方法。
- 仅使用原始数据集30%样本、通过困惑度剪枝训练的模型,在测试困惑度上比最佳EL2N剪枝模型高出2.1%,比最佳记忆度剪枝模型高出1.6%。
- 即使仅使用50%的数据,基于困惑度剪枝的模型在测试困惑度上仍比完整基线模型高出1.33%,比基于EL2N和记忆度的模型分别高出1.77%。
- 剪枝带来的性能提升在不同模型规模(124M至1.5B参数)下保持一致,表明该方法具有良好的可扩展性。
- 剪枝最低困惑度(最简单)样本会降低性能,表明‘最简单’的数据并非预训练的最优选择。
- 通过困惑度剪枝,仅使用一半数据即实现了1%的测试困惑度改进,证明了极高的数据效率。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。