Skip to main content
QUICK REVIEW

[论文解读] Progressive Skeletonization: Trimming more fat from a network at initialization

Pau de Jorge, Amartya Sanyal|arXiv (Cornell University)|Jun 16, 2020
Advanced Neural Network Applications参考文献 33被引用 40
一句话总结

本文提出 FORCE 及两种逐步剪枝方案(Iterative SNIP 与 FORCE)在初始化时对网络进行剪枝,在保持可训练性的同时实现极高的稀疏性,且在极端稀疏情况下常常优于 SNIP/GRASP。它展示了在某些设置下可剪掉多达 99.5% 的参数。

ABSTRACT

Recent studies have shown that skeletonization (pruning parameters) of networks extit{at initialization} provides all the practical benefits of sparsity both at inference and training time, while only marginally degrading their performance. However, we observe that beyond a certain level of sparsity (approx $95\%$), these approaches fail to preserve the network performance, and to our surprise, in many cases perform even worse than trivial random pruning. To this end, we propose an objective to find a skeletonized network with maximum {\em foresight connection sensitivity} (FORCE) whereby the trainability, in terms of connection sensitivity, of a pruned network is taken into consideration. We then propose two approximate procedures to maximize our objective (1) Iterative SNIP: allows parameters that were unimportant at earlier stages of skeletonization to become important at later stages; and (2) FORCE: iterative process that allows exploration by allowing already pruned parameters to resurrect at later stages of skeletonization. Empirical analyses on a large suite of experiments show that our approach, while providing at least as good a performance as other recent approaches on moderate pruning levels, provides remarkably improved performance on higher pruning levels (could remove up to $99.5\%$ parameters while keeping the networks trainable). Code can be found in https://github.com/naver/force.

研究动机与目标

  • 提出在初始化阶段进行剪枝的动机,以在没有代价高昂的密集训练的情况下获得训练时和推理时的稀疏性收益。
  • 引入 FORCE 作为一种能捕捉剪枝后可训练性的显著性标准。
  • 提出两种逐步剪枝程序(Iterative SNIP 和 FORCE)以最大化 FORCE。
  • 演示在不同数据集和体系结构上的鲁棒性和有效性,包括非常高的稀疏水平。

提出的方法

  • 将 FORCE 定义为剪枝后的显著性:g(θ̄) = ∂L(θ̄)/∂c 在 c = ĉ 处的值,等价于 (∂L(θ̄)/∂θ̄) ∘ θ (Eq. 5)。
  • 给出 FORCE 目标:maxc S(θ, c) = sum_{i in supp(c)} |θ_i ∂L(θ ∘ c)/∂(θ ∘ c)| (Eq. 6)。
  • 提出 Iterative SNIP:通过求解剪枝后的 SNIP 目标来逐步剪枝,同时保留先前保留的连接(c_t+1 尊重 c_t)。
  • 提出 FORCE:允许已剪枝的权重重新生长的迭代剪枝,在逐步稀疏化的同时在剪枝后的网络上重新计算 FORCE 显著性。
  • 与 SNIP 和 GRASP 比较,强调 SNIP/GRASP 依赖剪枝前的显著性,在高稀疏度下可能失效;FORCE 优化的是剪枝后的显著性。
  • 使用指数稀疏度计划 k_t 来控制剪枝步骤(Eq. 8)。
  • 提供理论洞见,Iterative SNIP 的中间掩码在小的剪枝步长下近似局部极小值。

实验结果

研究问题

  • RQ1在初始化时进行剪枝是否能在极高稀疏水平下(例如>95%)产生可训练的子网络?
  • RQ2是否通过最大化前瞻性连接敏感性(FORCE)来在稀疏度增加时实现更好的剪枝决策迁移?
  • RQ3迭代剪枝策略(Iterative SNIP 和 FORCE)是否在高稀疏度下优于单次显著性方法如 SNIP/GRASP?
  • RQ4在寻找可训练稀疏网络时,探索(FORCE)与开发(Iterative SNIP)的权衡是什么?

主要发现

  • FORCE 与 Iterative SNIP 在高稀疏度下在 CIFAR-10、CIFAR-100、Tiny ImageNet 和 ImageNet 上显著优于 SNIP 与 GRASP。
  • 对于 CIFAR-10 的 ResNet50 和 VGG19,即使极端稀疏(高达 99.9%),也能得到可训练的网络,准确率远高于随机;FORCE 的准确率显著高于其他方法。
  • 在 ImageNet 上,FORCE 使用 VGG19 可实现高达 90% 稀疏度(Top-1 70.2,Top-5 89.5)和 95% 稀疏度(Top-1 65.8,Top-5 86.8);对于 ResNet50 在 90% 稀疏度下,Top-1 64.9 和 Top-5 86.5(95% 稀疏度:Top-1 59.0,Top-5 82.3)。
  • FORCE 能在某些体系结构上剪掉多达 99.5% 的参数,同时保持网络可训练,这是先前方法在该稀疏水平下恶化或不及随机剪枝的水平。
  • Iterative SNIP 通常鲁棒,经过足够的迭代可以接近 FORCE 的性能,但 FORCE 常因允许恢复先前剪枝的权重(探索)而获得更好的结果。
  • 剪枝成本与效率:FORCE/Iter SNIP 比 GRASP-MB 更便宜,且在较少的计算开销下也能实现与基于 Hessian 的 GRASP 相当或更优的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。