[论文解读] Pruning's Effect on Generalization Through the Lens of Training and Regularization
本文挑战了长期以来认为剪枝通过减小模型规模从而提升泛化能力的假设。通过实证分析,本文表明剪枝带来的泛化增益主要源于训练时间的延长和额外的正则化效应,而非模型规模的减小——尤其在过参数化模型中,更大的模型通常具有更好的泛化能力。
Practitioners frequently observe that pruning improves model generalization. A long-standing hypothesis based on bias-variance trade-off attributes this generalization improvement to model size reduction. However, recent studies on over-parameterization characterize a new model size regime, in which larger models achieve better generalization. Pruning models in this over-parameterized regime leads to a contradiction -- while theory predicts that reducing model size harms generalization, pruning to a range of sparsities nonetheless improves it. Motivated by this contradiction, we re-examine pruning's effect on generalization empirically. We show that size reduction cannot fully account for the generalization-improving effect of standard pruning algorithms. Instead, we find that pruning leads to better training at specific sparsities, improving the training loss over the dense model. We find that pruning also leads to additional regularization at other sparsities, reducing the accuracy degradation due to noisy examples over the dense model. Pruning extends model training time and reduces model size. These two factors improve training and add regularization respectively. We empirically demonstrate that both factors are essential to fully explaining pruning's impact on generalization.
研究动机与目标
- 探究为何在过参数化设置下,剪枝能改善泛化能力,尽管这与经典偏差-方差理论相矛盾。
- 检验模型规模减小是否足以解释现代深度学习模型中剪枝带来的泛化增益。
- 分离训练时长与正则化在剪枝引发的泛化改进中的贡献。
- 评估微调和权重移除在塑造模型泛化能力方面的作用,超越架构变化的影响。
- 提供实证证据,表明剪枝的优势并非源于容量减少,而是训练动态与正则化效应。
提出的方法
- 将剪枝模型与‘增强训练’模型进行对比,后者复制了剪枝的训练调度和周期,但保留所有权重。
- 使用循环学习率调度和延长训练时长,以隔离训练时间对泛化的影响。
- 通过EL2N分数测量在噪声样本上的训练损失差异,以评估正则化效应。
- 采用不同权重移除启发式方法(如权重大小、SynFlow、随机)评估其对泛化的影响。
- 在稀疏模型正确预测的数据子集上训练模型,以比较其与稠密模型的泛化性能。
- 分析在不同噪声水平下,稀疏与稠密模型之间的损失差异,以量化正则化收益。
实验结果
研究问题
- RQ1模型规模减小是否能完全解释过参数化模型中剪枝带来的泛化能力提升?
- RQ2与权重移除相比,延长训练时间在剪枝泛化增益中所起的作用有多大?
- RQ3剪枝如何影响模型在噪声样本上的训练损失?这是否表明存在额外的正则化?
- RQ4能否通过使用相同调度和时长训练稠密模型来复现剪枝带来的泛化改进?
- RQ5不同权重选择启发式方法(如权重大小、SynFlow)在剪枝引发的正则化与泛化中起到何种作用?
主要发现
- 剪枝带来的泛化能力提升并非源于模型规模减小,因为即使不移除权重,仅通过相同调度和时长训练的模型也能达到相近的测试准确率。
- 在低稀疏度水平(例如,保留15%的权重)下,剪枝模型的训练损失低于稠密模型,表明训练过程中优化能力得到改善。
- 在高稀疏度水平(例如,保留60%的权重)下,剪枝模型的训练损失增加,但对关键样本的退化程度降低,表明正则化能力增强。
- 训练时间延长与正则化效应的结合——尤其是对噪声样本的处理——解释了剪枝泛化增益的大部分原因。
- 即使禁用权重移除,仅通过与剪枝相同的循环学习率和周期数训练的模型也能实现相似的泛化性能,证明训练动态是该效应的核心。
- 当训练时长和调度保持不变时,权重选择启发式方法(如权重大小、SynFlow)对泛化增益的影响微乎其微,进一步表明该效应与模型架构大小无关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。