Skip to main content
QUICK REVIEW

[论文解读] Group Sparsity: The Hinge Between Filter Pruning and Decomposition for Network Compression

Yawei Li, Shuhang Gu|Lirias (KU Leuven)|Mar 19, 2020
Sparse and Compressive Sensing Techniques参考文献 54被引用 18
一句话总结

该论文提出了一种统一的神经网络压缩框架,利用组稀疏性作为连接滤波器剪枝与低秩分解的枢纽。通过在可学习的稀疏性诱导矩阵上施加组稀疏性正则化,该方法可动态在剪枝(通过列稀疏性)与分解(通过行稀疏性)之间切换,在CIFAR-10、CIFAR-100和ImageNet基准上实现了端到端联合优化下的最先进精度-压缩权衡。

ABSTRACT

In this paper, we analyze two popular network compression techniques, i.e. filter pruning and low-rank decomposition, in a unified sense. By simply changing the way the sparsity regularization is enforced, filter pruning and low-rank decomposition can be derived accordingly. This provides another flexible choice for network compression because the techniques complement each other. For example, in popular network architectures with shortcut connections (e.g. ResNet), filter pruning cannot deal with the last convolutional layer in a ResBlock while the low-rank decomposition methods can. In addition, we propose to compress the whole network jointly instead of in a layer-wise manner. Our approach proves its potential as it compares favorably to the state-of-the-art on several benchmarks.

研究动机与目标

  • 在单一优化框架下统一滤波器剪枝与低秩分解,以实现神经网络压缩。
  • 解决残差网络中滤波器剪枝的局限性,即在ResBlock中剪枝最后一层卷积会破坏跳跃连接。
  • 实现整个网络的联合压缩,而非逐层压缩,从而提升整体模型效率。
  • 通过灵活统一的机制,结合剪枝(参数减少)与分解(计算量节省)的互补优势。
  • 在多个基准上实现精度与FLOP减少的最先进性能。

提出的方法

  • 引入一个可学习的稀疏性诱导矩阵A,通过在其列或行上实现组稀疏性,作为连接剪枝与分解的枢纽。
  • 对矩阵A的列施加组稀疏性正则化,以减少输出通道数,等价于通过矩阵乘积W × A^c实现滤波器剪枝。
  • 对矩阵A的行施加组稀疏性正则化,以减少内部维度,从而通过两个轻量级卷积W^r与A^r实现低秩分解。
  • 使用带有自适应学习率、层平衡与正则化因子退火的近端梯度下降法求解优化问题。
  • 在微调过程中采用知识蒸馏,以在压缩过程中保持精度。
  • 对整个网络进行联合优化,而非逐层优化,从而提升全局压缩效率。

实验结果

研究问题

  • RQ1滤波器剪枝与低秩分解能否在单一优化框架下实现统一?
  • RQ2稀疏性诱导矩阵中的组稀疏性如何实现剪枝与分解模式之间的动态切换?
  • RQ3整个网络的联合端到端压缩是否优于逐层压缩策略?
  • RQ4所提方法能否克服残差网络中滤波器剪枝的局限性,特别是在具有跳跃连接的层中?
  • RQ5正则化类型与退火策略对压缩性能与泛化能力有何影响?

主要发现

  • 在CIFAR-10上,该方法在50%压缩率下达到6.37%的Top-1错误率,优于SSS(25.82%)及其他SOTA方法。
  • 在CIFAR-100的ResNet-164上,该方法在使用正则化退火时性能优于CGES与SSS,甚至在无蒸馏情况下也表现更优。
  • 在ImageNet-2012上,该方法在Top-1错误率与FLOP压缩率之间实现了最先进权衡,优于KSE与SSS等方法。
  • 消融实验表明,ℓ₁正则化在T=0.005与α=0.01时性能最佳,且对超参数变化具有极低敏感性。
  • 在相似压缩率下,与先前工作相比,该方法在VGG上将Top-1错误率降低0.41%,在DenseNet上降低1.51%。
  • 在所有压缩水平下,FLOP与参数减少均显著优于KSE,且在相近错误率下实现了更低的FLOPs。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。