Skip to main content
QUICK REVIEW

[论文解读] Sparse Double Descent: Where Network Pruning Aggravates Overfitting

Zheng He, Zeke Xie|arXiv (Cornell University)|Jun 17, 2022
Neural Networks and Applications被引用 4
一句话总结

本文提出了一个新颖的“稀疏双下降”现象,即在剪枝初期,由于过拟合,模型泛化能力可能先恶化,随后改善,最终在极端稀疏性下性能再次下降。文章提出,ℓ₂学习距离(衡量训练过程中模型权重移动距离的指标)比极小值平坦度更能预测泛化性能,并解释了在剪枝模型中观察到的非单调测试准确率曲线。

ABSTRACT

People usually believe that network pruning not only reduces the computational cost of deep networks, but also prevents overfitting by decreasing model capacity. However, our work surprisingly discovers that network pruning sometimes even aggravates overfitting. We report an unexpected sparse double descent phenomenon that, as we increase model sparsity via network pruning, test performance first gets worse (due to overfitting), then gets better (due to relieved overfitting), and gets worse at last (due to forgetting useful information). While recent studies focused on the deep double descent with respect to model overparameterization, they failed to recognize that sparsity may also cause double descent. In this paper, we have three main contributions. First, we report the novel sparse double descent phenomenon through extensive experiments. Second, for this phenomenon, we propose a novel learning distance interpretation that the curve of $\ell_{2}$ learning distance of sparse models (from initialized parameters to final parameters) may correlate with the sparse double descent curve well and reflect generalization better than minima flatness. Third, in the context of sparse double descent, a winning ticket in the lottery ticket hypothesis surprisingly may not always win.

研究动机与目标

  • 探究网络剪枝对模型泛化的影响,挑战‘剪枝总是减少过拟合’的普遍认知。
  • 识别并实证验证一种新现象——‘稀疏双下降’,即在稀疏性下测试性能呈现非单调曲线,包含三个阶段:恶化、改善、最终退化。
  • 提出并验证ℓ₂学习距离作为稀疏模型中优于极小值平坦度的泛化性能指标。
  • 在稀疏双下降背景下重新审视彩票假说,表明重新训练时,获胜票(winning tickets)并不总能保持最优性能。

提出的方法

  • 通过基于大小的剪枝方法,在多个架构(LeNet-300-100、ResNet-18)和数据集(MNIST、CIFAR-10、CIFAR-100)上系统性地增加模型稀疏性,同时调整标签噪声水平。
  • 测量并分析ℓ₂学习距离,即最终与初始模型权重之间差值的L2范数,并将其与不同稀疏度下的测试准确率进行相关性分析。
  • 比较不同微调策略下的泛化性能:微调、学习率重置(learning rate rewinding)以及剪枝后从随机初始化重新训练。
  • 在稀疏模型与重新恢复稠密的模型之间进行线性插值,分析损失和准确率轨迹,评估极小值的尖锐程度。
  • 使用滤波器归一化可视化损失景观,评估重新恢复稠密训练场景下极小值的尖锐程度。
  • 在不同稀疏度和噪声率下进行消融研究,以验证稀疏双下降曲线的稳健性。

实验结果

研究问题

  • RQ1网络剪枝是否总是减少过拟合,还是有时反而会恶化泛化?
  • RQ2双下降行为是否仅在模型过参数化时出现,还是在稀疏性增加时也会出现?
  • RQ3ℓ₂学习距离在剪枝模型中不同稀疏度下与测试性能的相关性如何?
  • RQ4在稀疏双下降背景下,彩票假说是否依然成立?还是随机初始化的剪枝模型可能优于原始获胜票的重新训练?
  • RQ5在极端稀疏性下性能退化的原因是什么?其与信息遗忘的关系如何?

主要发现

  • 本文报告了一种新颖的‘稀疏双下降’现象:在中等稀疏性下,测试准确率首先因过拟合而下降,随后因过拟合减少而改善,最终在极端稀疏性下因信息丢失而再次下降。
  • 剪枝模型的ℓ₂学习距离与稀疏双下降曲线强相关,且在泛化预测方面优于极小值平坦度,尤其在过拟合阶段表现更优。
  • 在中等稀疏性水平下,剪枝模型表现出更高的过拟合程度,测试准确率显著下降——例如,在20%标签噪声下,准确率可能比稠密模型低15–20%。
  • 彩票假说中的获胜票并不总能实现最佳泛化;在某些情况下,从随机初始化重新训练剪枝模型的性能优于从原始获胜票初始化重新训练。
  • 在剪枝后从零初始化权重重新训练,可能产生更尖锐的极小值,尤其在高稀疏性下,这通过1D损失可视化得以证实。
  • 在稀疏双下降的‘关键阶段’(即过拟合最严重时),ℓ₂学习距离对泛化的预测能力最强,表明其能有效捕捉灾难性过拟合期间权重轨迹的动力学特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。