Skip to main content
QUICK REVIEW

[论文解读] Effective Sparsification of Neural Networks with Global Sparsity Constraint

Xiao Zhou, Weizhong Zhang|arXiv (Cornell University)|May 3, 2021
Advanced Neural Network Applications参考文献 41被引用 4
一句话总结

该论文提出ProbMask,一种新颖的网络稀疏化方法,利用概率作为全局标准,自动确定所有层的权重重要性和稀疏度水平,避免了手动调整剪枝率。通过将剪枝建模为概率空间上的连续优化问题,并施加全局稀疏度约束,结合Gumbel-Softmax技巧,ProbMask在高稀疏度下实现了最先进(SOTA)的准确率,尤其在ImageNet上,Top-1准确率相比之前方法最高提升10%。

ABSTRACT

Weight pruning is an effective technique to reduce the model size and inference time for deep neural networks in real-world deployments. However, since magnitudes and relative importance of weights are very different for different layers of a neural network, existing methods rely on either manual tuning or handcrafted heuristic rules to find appropriate pruning rates individually for each layer. This approach generally leads to suboptimal performance. In this paper, by directly working on the probability space, we propose an effective network sparsification method called {\it probabilistic masking} (ProbMask), which solves a natural sparsification formulation under global sparsity constraint. The key idea is to use probability as a global criterion for all layers to measure the weight importance. An appealing feature of ProbMask is that the amounts of weight redundancy can be learned automatically via our constraint and thus we avoid the problem of tuning pruning rates individually for different layers in a network. Extensive experimental results on CIFAR-10/100 and ImageNet demonstrate that our method is highly effective, and can outperform previous state-of-the-art methods by a significant margin, especially in the high pruning rate situation. Notably, the gap of Top-1 accuracy between our ProbMask and existing methods can be up to 10\%. As a by-product, we show ProbMask is also highly effective in identifying supermasks, which are subnetworks with high performance in a randomly weighted dense neural network.

研究动机与目标

  • 解决在神经网络稀疏化中选择最优、分层剪枝率的挑战,因为手动设定往往困难且次优。
  • 开发一种全局可比的权重重要性度量标准,确保所有层之间的一致性,克服基于大小或归一化得分方法的局限性。
  • 通过在概率空间中施加全局稀疏度约束,自动学习各层的冗余预算,从而消除对每层手动调整剪枝率的需求。
  • 解决先前剪枝方法在大规模数据集(如ImageNet)上存在的训练-测试性能差异问题。
  • 在随机初始化的网络中有效识别高性能子网络(即超级掩码,supermasks)。

提出的方法

  • 将网络剪枝建模为在二值掩码的概率空间上的连续优化问题,其中每个掩码元素为具有可学习概率的伯努利随机变量。
  • 引入全局稀疏度约束,限制所有概率之和以控制整体模型稀疏度,从而实现在每层自动检测冗余。
  • 使用Gumbel-Softmax重参数化技巧,对概率参数进行可微训练,允许通过离散掩码采样进行反向传播。
  • 在Gumbel-Softmax中应用温度退火调度,以促进概率收敛至0或1,形成确定性的稀疏掩码。
  • 在概率空间上施加ℓ₁正则化,以促进稀疏性并改善收敛至低方差、确定性掩码。
  • 将最终掩码视为稀疏二值网络,实现无需微调的高效推理。

实验结果

研究问题

  • RQ1概率能否作为深度神经网络中不同层之间权重重要性的全局可比度量?
  • RQ2在概率空间中施加全局稀疏度约束,是否在高剪枝率下优于分层稀疏度约束,从而提升准确率?
  • RQ3所提出的方法能否在无需手动调优的情况下自动学习各层适当的稀疏度预算?
  • RQ4ProbMask能否缓解先前剪枝方法在大规模数据集上存在的训练-测试性能差异?
  • RQ5ProbMask能否在随机初始化的密集网络中有效识别出高准确率的超级掩码?

主要发现

  • 在ResNet50上,ProbMask在ImageNet上实现99.9%剪枝率下的Top-1准确率为74.68%,相比之前SOTA方法最高提升10个百分点。
  • 在ResNet32的CIFAR-100上,ProbMask在99.9%剪枝率下仍保持高准确率,而PBW和MLPrune则崩溃,表明基于概率的重要性评分具有更优的全局可比性。
  • 在CIFAR-10上,99.9%剪枝率下,概率空间中的全局稀疏度约束使准确率比分层均匀稀疏度高出57.75%,证明了逐层预算自适应的重要性。
  • ProbMask在CIFAR-100上成功识别出仅含原始权重2%的超级掩码,在权重固定于初始化时达到近50%准确率。
  • 最终掩码的概率分布收敛至0或1,所有层均一致,证实掩码在训练后变为确定性且稀疏。
  • 该方法在模型(ResNet、VGG、DenseNet)和数据集(CIFAR-10/100、ImageNet)上均表现出鲁棒性,持续优于基于大小和Hessian的剪枝基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。