[论文解读] Sparse Progressive Distillation: Resolving Overfitting under Pretrain-and-Finetune Paradigm
本文提出稀疏渐进蒸馏(SPD),一种通过结合渐进式模块嫁接、知识蒸馏和稀疏剪枝来减少微调过程中剪枝后的 BERT 类模型过拟合风险的方法。SPD 在 GLUE 基准测试中优于当前最先进方法,平均得分达到 84.5,高于微调 BERT 的 83.7,尤其在 MNLI 和 CoLA 等任务上表现显著提升。
Conventional wisdom in pruning Transformer-based language models is that pruning reduces the model expressiveness and thus is more likely to underfit rather than overfit. However, under the trending pretrain-and-finetune paradigm, we postulate a counter-traditional hypothesis, that is: pruning increases the risk of overfitting when performed at the fine-tuning phase. In this paper, we aim to address the overfitting problem and improve pruning performance via progressive knowledge distillation with error-bound properties. We show for the first time that reducing the risk of overfitting can help the effectiveness of pruning under the pretrain-and-finetune paradigm. Ablation studies and experiments on the GLUE benchmark show that our method outperforms the leading competitors across different tasks.
研究动机与目标
- 为解决在预训练-微调范式中,微调阶段剪枝引入的反直觉过拟合风险。
- 探究为何在预训练-微调范式下,剪枝反而会增加过拟合风险,尽管传统观念认为剪枝应有助于缓解过拟合。
- 开发一种方法,在剪枝过程中同时保留通用知识和任务特定知识,以减轻过拟合。
- 通过整合渐进式嫁接与知识蒸馏,在高稀疏度下提升模型性能与鲁棒性。
- 通过实证验证剪枝在微调阶段会增加过拟合风险的假设,并展示 SPD 对该问题的有效缓解。
提出的方法
- SPD 使用一个与教师模型剪枝层架构一致的学生模型,实现将稀疏学生模块逐步嫁接到教师模型中。
- 采用渐进式嫁接策略,逐步提高用学生模块替换教师层的概率,以实现稳定的知识迁移。
- 在剪枝过程中应用知识蒸馏,将教师模型的知识迁移至学生模型,从而最小化性能下降。
- 采用双优化器策略:一个用于剪枝,一个用于蒸馏,分别设置学习率调度,以减少相互干扰。
- 使用动态剪枝率调度器,当嫁接概率达到目标值时停止剪枝,以平衡训练速度与精度。
- 最终模型为一个嫁接后的稀疏学生网络,在参数量显著减少的同时保持高性能。
实验结果
研究问题
- RQ1在预训练-微调范式中,微调阶段的剪枝是否确实会增加过拟合风险,与传统观念相悖?
- RQ2渐进式模块嫁接与知识蒸馏能否协同缓解剪枝后的预训练语言模型的过拟合问题?
- RQ3在高稀疏度下,剪枝率、嫁接概率与学习率之间的相互作用如何影响模型泛化能力?
- RQ4知识蒸馏与渐进式嫁接在剪枝过程中减少过拟合的相对贡献分别是什么?
- RQ5能否通过 SPD 识别出一个子网络,其性能可匹配教师模型,同时参数量显著更小?
主要发现
- SPD 在 GLUE 基准上取得 84.5 的平均得分,优于微调后的 BERT 教师模型(83.7)以及所有领先竞争方法。
- 在 MNLI 任务上,SPD 达到 85.0% 的准确率,超过教师模型的 84.0%,展现出更优的泛化能力。
- 在 CoLA 任务上,SPD 的 Matthews 相关系数达到 61.4%,显著优于微调 BERT 教师模型的 57.9%。
- 消融实验表明,结合渐进式嫁接与知识蒸馏比单独使用任一方法更有效地缩小训练集与验证集之间的性能差距。
- 嫁接概率为 0.6 时性能最优,且双优化器策略相比单优化器能提升收敛速度与最终准确率。
- 该方法有效缓解了过拟合,表现为在高稀疏度下训练集与验证集之间的性能差距更小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。