Skip to main content
QUICK REVIEW

[论文解读] Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models

Zachary Ankner, Cody Blakeney|arXiv (Cornell University)|May 30, 2024
Algorithms and Data Compression被引用 4
一句话总结

本文提出使用参数量较小的语言模型(125M参数)计算大规模预训练数据集的困惑度分数,以实现对数据的剪枝,显著提升更大模型(3B参数)的下游性能。实验表明,利用小型参考模型进行基于困惑度的剪枝,可将预训练步数减少最多1.45倍,并在不同数据集构成下将平均下游准确率提升最多2.04个百分点。

ABSTRACT

In this work, we investigate whether small language models can determine high-quality subsets of large-scale text datasets that improve the performance of larger language models. While existing work has shown that pruning based on the perplexity of a larger model can yield high-quality data, we investigate whether smaller models can be used for perplexity-based pruning and how pruning is affected by the domain composition of the data being pruned. We demonstrate that for multiple dataset compositions, perplexity-based pruning of pretraining data can \emph{significantly} improve downstream task performance: pruning based on perplexities computed with a 125 million parameter model improves the average performance on downstream tasks of a 3 billion parameter model by up to 2.04 and achieves up to a $1.45 imes$ reduction in pretraining steps to reach commensurate baseline performance. Furthermore, we demonstrate that such perplexity-based data pruning also yields downstream performance gains in the over-trained and data-constrained regimes.

研究动机与目标

  • 评估小型语言模型是否能有效识别出适合大规模语言模型预训练的高质量数据子集。
  • 研究数据集领域构成如何影响基于困惑度的剪枝方法的有效性。
  • 评估在非标准训练设置(如过拟合训练和数据受限环境)下,基于困惑度的剪枝的影响。
  • 确定上游测试集困惑度是否可作为数据剪枝干预中下游性能提升的可靠代理指标。
  • 比较在不同领域分布的数据集(如Pile和Dolma)上,基于困惑度的剪枝策略在不同数据集中的有效性差异。

提出的方法

  • 在预训练数据集的随机子集上训练一个小型参考语言模型(125M参数)。
  • 使用该小型参考模型计算完整数据集中每个样本的困惑度分数。
  • 通过选择特定困惑度范围内的样本(即最低或最高困惑度分数)对数据集进行剪枝。
  • 在剪枝后的数据集上微调一个更大的目标模型(3B参数),并评估其下游性能。
  • 使用多个下游基准测试(如MMLU、HellaSwag、BIG-bench)评估模型性能,以超越上游指标的评估范围。
  • 比较在不同领域构成的数据集(包括多样化的精选领域,如Pile,以及网络爬取数据,如Dolma)上的剪枝效果。

实验结果

研究问题

  • RQ1小型参考模型能否有效识别出能提升更大目标语言模型性能的高质量数据子集?
  • RQ2预训练数据集的领域构成如何影响基于困惑度的剪枝方法的有效性?
  • RQ3在过拟合训练和数据受限的训练设置下,基于困惑度的数据剪枝是否能带来性能增益?
  • RQ4上游测试集困惑度是否可作为数据剪枝干预中下游性能提升的可靠指标?
  • RQ5在不同领域分布的数据集上,不同剪枝策略(如选择低困惑度或高困惑度样本)的有效性如何变化?

主要发现

  • 使用125M参数参考模型进行基于困惑度的剪枝,使3B参数目标模型在基准评估中的平均下游性能最高提升2.04分。
  • 相同的剪枝策略将达到基线性能所需的预训练步数最多减少1.45倍,表明训练效率显著提升。
  • 剪枝效果在不同数据集间存在显著差异:该方法在Pile(多样化、精选领域)上表现最佳,在Dolma(网络爬取数据主导)上效果较弱,表明对领域构成具有高度敏感性。
  • 基于困惑度的剪枝在过拟合训练和数据受限的训练设置中均带来可测量的性能增益,证明其在标准预训练设置之外也具备鲁棒性。
  • 上游测试集困惑度被发现是评估数据剪枝有效性的误导性指标,因为某些干预措施在不改变上游指标的情况下仍能提升下游性能。
  • 本研究证实,即使目标模型的参数量是参考模型的30倍,小型参考模型仍可作为数据质量过滤的有效代理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。