[论文解读] BERT on a Data Diet: Finding Important Examples by Gradient-Based Pruning
该论文将原本为计算机视觉设计的基于梯度的数据剪枝指标 GraNd 和 EL2N 适配至自然语言处理领域,表明在至少完成一个训练周期后,通过这些指标筛选出最重要样本子集进行 BERT 微调,可在完整数据集上保持甚至超越性能。关键发现是:剪枝得分最高的(可能为噪声样本)数据反而能提升泛化能力,尤其在 MNLI 数据集上,使用 66% 的数据即可获得高于完整数据集的准确率。
Current pre-trained language models rely on large datasets for achieving state-of-the-art performance. However, past research has shown that not all examples in a dataset are equally important during training. In fact, it is sometimes possible to prune a considerable fraction of the training set while maintaining the test performance. Established on standard vision benchmarks, two gradient-based scoring metrics for finding important examples are GraNd and its estimated version, EL2N. In this work, we employ these two metrics for the first time in NLP. We demonstrate that these metrics need to be computed after at least one epoch of fine-tuning and they are not reliable in early steps. Furthermore, we show that by pruning a small portion of the examples with the highest GraNd/EL2N scores, we can not only preserve the test accuracy, but also surpass it. This paper details adjustments and implementation choices which enable GraNd and EL2N to be applied to NLP.
研究动机与目标
- 将原本用于计算机视觉的基于梯度的数据重要性指标 GraNd 和 EL2N 适配至自然语言处理领域,以识别重要训练样本。
- 探究这些指标是否能有效识别预训练语言模型(如 BERT)中的高价值训练样本。
- 评估剪枝低重要性样本(尤其是 GraNd/EL2N 得分高的样本)是否能提升或维持模型性能。
- 确定在预训练语言模型的微调过程中,计算这些得分的最佳时机,以应对 PLM 独特的动态特性。
- 评估是否移除高分样本(可能为噪声样本)可带来优于完整数据集训练的泛化性能。
提出的方法
- 通过多次随机权重初始化,估计损失梯度相对于模型权重的期望 L2 范数,计算 GraNd 得分。
- 使用 EL2N 近似 GraNd,EL2N 定义为预测误差(预测值 - one-hot 标签)的期望 L2 范数,通过多次训练运行计算得出。
- 使用五个独立的训练运行(不同随机种子)计算每个训练样本的稳定、平均化的 EL2N 和 GraNd 得分。
- 在完成一个完整微调周期后,根据 EL2N 或 GraNd 得分对训练样本进行排序,选取并微调 BERT-base 模型的 top k% 样本。
- 使用准确率作为指标,在 AG News(主题分类)和 MNLI(自然语言蕴含)任务上评估性能。
- 与随机剪枝基线和完整数据集微调结果对比,评估结构化剪枝带来的性能增益。
实验结果
研究问题
- RQ1GraNd 和 EL2N 这两个最初为视觉任务设计的指标,能否在 NLP 及 BERT 等预训练语言模型中有效适配?
- RQ2在预训练语言模型的上下文中,是否必须至少完成一个完整微调周期后,GraNd/EL2N 得分才变得可靠?
- RQ3剪枝得分最高的样本(按 GraNd/EL2N 衡量)是否能带来优于完整数据集训练的测试性能?
- RQ4在基于 EL2N/GraNd 选择的样本中,保留数据比例的变化如何影响模型性能?
- RQ5在 NLP 任务中,移除少量高分样本(可能为噪声样本)是否能提升模型泛化能力?
主要发现
- 在 NLP 中,必须至少完成一个完整微调周期后,GraNd 和 EL2N 得分才变得可靠,可用于数据子集选择,这与视觉任务中早期得分即具信息量的情况不同。
- 在 MNLI 数据集上,使用 66% 的数据(移除 top 4% 最高分样本)微调 BERT 所得准确率高于使用完整数据集的微调结果。
- 在 AG News 上,剪枝最高分样本可实现与完整训练相当的性能,但仅使用 67% 的数据,表明具有数据效率优势。
- 使用单个随机种子计算的 EL2N 和 GraNd 得分与使用五个种子计算的得分高度相关(Spearman r = 0.9311),表明每个种子运行一个周期已足够获得可靠的剪枝结果。
- 基于 EL2N/GraNd 选择 top-k% 样本训练的模型性能随保留数据比例增加而单调提升,且当保留至少 70% 数据时,性能超过随机剪枝。
- 在某些情况下(如 MNLI),移除最高分样本反而带来优于包含它们的泛化性能,表明高分样本可能对应噪声或难以学习的样本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。