[论文解读] Deduplicating Training Data Makes Language Models Better
本文提出了一种可扩展的去重框架,用于语言模型训练数据集,通过精确子串匹配和基于n-gram哈希的近似文档匹配实现。实验表明,从C4等数据集中去除近似重复和完全重复的文本,可使微调模型的遗忘率降低10倍,提升训练效率,并通过消除训练-测试集重叠,实现更准确的模型评估。
We find that existing language modeling datasets contain many near-duplicate examples and long repetitive substrings. As a result, over 1% of the unprompted output of language models trained on these datasets is copied verbatim from the training data. We develop two tools that allow us to deduplicate training datasets -- for example removing from C4 a single 61 word English sentence that is repeated over 60,000 times. Deduplication allows us to train models that emit memorized text ten times less frequently and require fewer train steps to achieve the same or better accuracy. We can also reduce train-test overlap, which affects over 4% of the validation set of standard datasets, thus allowing for more accurate evaluation. We release code for reproducing our work and performing dataset deduplication at https://github.com/google-research/deduplicate-text-datasets.
研究动机与目标
- 调查C4、Wiki-40B、LM1B和RealNews等广泛使用的语言模型训练数据集中重复和近似重复内容的普遍性。
- 解决训练-测试数据集重叠和数据重复导致模型性能指标虚高以及语言模型遗忘率增加的问题。
- 开发并评估一种可扩展、计算高效的去重流水线,以从大规模数据集中去除完全重复和近似重复的文本。
- 证明去重后的数据集可使模型的遗忘率显著降低,训练效率提高,评估结果更可靠。
提出的方法
- 使用精确子串匹配检测并去除数据集中不同样本间完全重复的文本片段。
- 通过基于n-gram重叠的局部敏感哈希(LSH)实现近似文档匹配,以识别高度相似的文档。
- 采用仅使用CPU、线性时间的算法处理数据集,实现在C4等TB级数据集上的可扩展去重。
- 测量去重对多种模型架构和数据集上模型遗忘率、困惑度和训练效率的影响。
- 通过对比原始数据集与去重后数据集上模型输出的差异,验证结果,重点关注记忆化文本的频率和测试集重叠情况。
- 将去重框架作为开源代码发布,以促进NLP研究中的可复现性和应用。
实验结果
研究问题
- RQ1在C4、Wiki-40B、LM1B和RealNews等标准NLP训练数据集中,近似重复和完全重复样本的普遍性如何?
- RQ2标准基准数据集中训练-测试数据集重叠在多大程度上影响模型评估并导致过拟合?
- RQ3对训练数据进行去重对微调语言模型中记忆化文本生成率有何影响?
- RQ4去重是否能通过困惑度和收敛速度的提升,改善训练效率和模型性能?
- RQ5去重后的数据集是否能通过减少虚假记忆化和数据泄露,实现更可靠、更准确的模型评估?
主要发现
- 在C4等标准数据集上训练的模型,其未提示生成的输出中,超过1%的内容为训练数据中完全记忆的文本。
- 去重使记忆化文本生成率降低10倍,经去重数据集训练的模型记忆化内容频率为0.14–0.19%,而原始数据集上为1.93–3.34%。
- 在C4中发现一个61个词的句子重复了61,036次,在验证集中重复61次,表明存在显著的训练-测试集重叠。
- 去重后的数据集最多小19%,减少训练时间、成本和环境影响,同时保持或提升困惑度。
- 在去重数据集上训练的模型可在更少的训练步数内达到相同或更高的准确率,证明训练效率得到提升。
- 去重不会降低困惑度;在某些情况下,困惑度甚至提升最高达10%,表明高质量的训练数据可带来更好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。