Skip to main content
QUICK REVIEW

[论文解读] Dependency Aware Filter Pruning

Kai Zhao, Xinyu Zhang|arXiv (Cornell University)|May 6, 2020
Advanced Neural Network Applications参考文献 66被引用 5
一句话总结

该论文提出了一种依赖感知的滤波器剪枝方法,通过考虑层间依赖关系来改进滤波器重要性的估计,采用局部的、逐层的标准而非全局排序。该方法动态控制稀疏性正则化,以实现目标压缩比率,在CIFAR、SVHN和ImageNet上优于Network Slimming,且剪枝后的架构更加稳定和准确。

ABSTRACT

Convolutional neural networks (CNNs) are typically over-parameterized, bringing considerable computational overhead and memory footprint in inference. Pruning a proportion of unimportant filters is an efficient way to mitigate the inference cost. For this purpose, identifying unimportant convolutional filters is the key to effective filter pruning. Previous work prunes filters according to either their weight norms or the corresponding batch-norm scaling factors, while neglecting the sequential dependency between adjacent layers. In this paper, we further develop the norm-based importance estimation by taking the dependency between the adjacent layers into consideration. Besides, we propose a novel mechanism to dynamically control the sparsity-inducing regularization so as to achieve the desired sparsity. In this way, we can identify unimportant filters and search for the optimal network architecture within certain resource budgets in a more principled manner. Comprehensive experimental results demonstrate the proposed method performs favorably against the existing strong baseline on the CIFAR, SVHN, and ImageNet datasets. The training sources will be publicly available after the review process.

研究动机与目标

  • 解决现有滤波器剪枝方法忽略层间依赖关系所导致的不稳定性和次优性能问题。
  • 通过建模相邻卷积层之间的关系,改进滤波器重要性的估计。
  • 提出一种局部的、逐层的剪枝标准,避免因全局排序滤波器重要性而导致的架构失衡。
  • 引入一种动态正则化控制机制,以在训练过程中实现精确且所需的稀疏度水平。
  • 在资源受限条件下实现更合理且稳定的神经网络压缩,同时保持最小的准确率损失。

提出的方法

  • 提出一种依赖感知的滤波器重要性评分,结合相邻层的卷积权重L1范数和批量归一化缩放因子。
  • 每层使用局部重要性标准,即某一层的稀疏性独立于其他层影响剪枝决策。
  • 引入一个在训练过程中动态调整的正则化系数λ,以达到目标稀疏比。
  • 对批量归一化缩放因子施加诱导稀疏性的L1正则化,其中λ根据当前稀疏度和目标值自适应更新。
  • 执行迭代剪枝与微调:使用动态λ进行训练,基于局部重要性剪枝滤波器,然后微调压缩后的模型。
  • 采用基于验证的策略确定最优剪枝比例,确保多次运行下的鲁棒性。

实验结果

研究问题

  • RQ1忽略层间依赖关系如何影响滤波器剪枝方法的稳定性和性能?
  • RQ2与全局排序相比,局部的、逐层的重要性标准是否能提升剪枝架构的质量?
  • RQ3动态正则化控制是否能在训练过程中实现更精确且一致的稀疏度控制?
  • RQ4在高剪枝比率下,该方法是否能在准确率和稳定性上优于Network Slimming?
  • RQ5从零开始训练与微调相比,剪枝后的架构质量如何?

主要发现

  • 在CIFAR-10和CIFAR-100上,该方法在剪枝比率分别为0.7和0.4时,分别达到93.93%和73.71%的Top-1准确率,优于Network Slimming (SLM)。
  • 在ResNet-164上,该方法在从零开始训练时达到76.43%的准确率,优于SLM在相同设置下的75.05%。
  • 在CIFAR-10的5折交叉验证中,SLM在所有运行中均崩溃(准确率为10.00%),而该方法保持了93.93%的准确率,且每层至少保留23个通道。
  • 该方法生成了更均衡且稳定的剪枝架构,如滤波器分布图所示,SLM产生了严重失衡的层间通道数量。
  • 动态正则化控制使模型能一致地收敛到目标稀疏度,消融实验验证了其在性能上优于静态λ设置。
  • 在ImageNet上的全面实验确认了该方法在性能上优于SLM,并与当前最先进的数据相关和数据无关剪枝方法具有竞争力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。