[论文解读] Pruning Neural Networks at Initialization: Why are We Missing the Mark?
本文在初始化时评估 SNIP、GraSP、SynFlow 和幅度剪枝,结果表明它们优于随机剪枝但在训练后通常落后于幅度剪枝;剪枝决策在很大程度上由逐层剪枝比例所决定,而非单个权重。
Recent work has explored the possibility of pruning neural networks at initialization. We assess proposals for doing so: SNIP (Lee et al., 2019), GraSP (Wang et al., 2020), SynFlow (Tanaka et al., 2020), and magnitude pruning. Although these methods surpass the trivial baseline of random pruning, they remain below the accuracy of magnitude pruning after training, and we endeavor to understand why. We show that, unlike pruning after training, randomly shuffling the weights these methods prune within each layer or sampling new initial values preserves or improves accuracy. As such, the per-weight pruning decisions made by these methods can be replaced by a per-layer choice of the fraction of weights to prune. This property suggests broader challenges with the underlying pruning heuristics, the desire to prune at initialization, or both.
研究动机与目标
- 评估在初始化时进行的修剪方法(SNIP、GraSP、SynFlow)相较于幅度修剪和随机基线的表现。
- 了解初始化剪枝决策是基于每个权重还是主要基于按层的稀疏比例。
- 识别消融实验,揭示这些方法实际使用的信息。
- 确定在常见架构和稀疏度下,初始化剪枝是否可与训练后剪枝相媲美。
提出的方法
- 通过单权重分数和移除操作定义稀疏度 s 的修剪。
- 在初始化时对 SNIP、GraSP、SynFlow、幅度修剪及基线进行单次修剪比较。
- 进行消融:权重置乱、重初始化和反转以测试敏感性。
- 在 CNN/ResNet 上进行评估(CIFAR-10、TinyImageNet、ImageNet),在训练后幅度修剪达到全精度的相同稀疏度下对比。
- 将分析扩展到初始化后的修剪,即在训练后再剪枝并重新训练。
实验结果
研究问题
- RQ1在标准网络中,初始化时的 SNIP、GraSP、SynFlow 和幅度修剪,与随机修剪和训练后幅度修剪相比,表现如何?
- RQ2初始化时的修剪决策是对单个权重敏感,还是主要依赖按层的稀疏比例?
- RQ3消融(洗牌、重新初始化、反转)是否揭示了初始化剪枝方法与训练后剪枝之间的根本差异?
- RQ4通过在训练后再剪枝或使用不同信号,初始化剪枝能否达到与训练后剪枝相当的精度?
主要发现
- 所有初始化时修剪方法在匹配稀疏度下都优于随机修剪,且并非单一方法在所有网络中最好。
- 训练后的幅度修剪往往在准确度和可达到的稀疏度上超过初始化时修剪。
- 在初始化时,SNIP、GraSP、SynFlow 和幅度修剪的决策在很大程度上被逐层剪枝比例所捕获;在层内洗牌不会降低性能。
- 重新初始化或洗牌未修剪的权重不会降低初始化时剪枝的表现,与训练后剪枝方法不同。
- SynFlow 在某些极端稀疏度下可能出现神经元崩溃行为,倾向更激进地修剪整个神经元。
- 当在初始化后进行剪枝时,这些方法的精度提升不如训练后幅度修剪迅速,表明初始化剪枝存在内在局限性;在训练后进行剪枝(LTR 基线)可以超过早期方法。
- 对这些方法在训练后再进行修剪(SNIP、SynFlow、幅度)的准确度有所提升,但在最极端的稀疏度下仍落后于 LTR,表明初始化剪枝存在更广泛的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。