Skip to main content
QUICK REVIEW

[论文解读] Single-shot Channel Pruning Based on Alternating Direction Method of Multipliers

Chengcheng Li, Zi Wang|arXiv (Cornell University)|Feb 18, 2019
Domain Adaptation and Few-Shot Learning参考文献 23被引用 4
一句话总结

该论文提出一种基于交替方向乘子法(ADMM)的单次通道剪枝方法,在训练过程中实现滤波器级别的稀疏性,从而实现一次剪枝与微调。该方法在多种模型架构和数据集上优于当前最先进的迭代剪枝方法(包括泰勒展开法),尤其在高剪枝率下表现更优。

ABSTRACT

Channel pruning has been identified as an effective approach to constructing efficient network structures. Its typical pipeline requires iterative pruning and fine-tuning. In this work, we propose a novel single-shot channel pruning approach based on alternating direction methods of multipliers (ADMM), which can eliminate the need for complex iterative pruning and fine-tuning procedure and achieve a target compression ratio with only one run of pruning and fine-tuning. To the best of our knowledge, this is the first study of single-shot channel pruning. The proposed method introduces filter-level sparsity during training and can achieve competitive performance with a simple heuristic pruning criterion (L1-norm). Extensive evaluations have been conducted with various widely-used benchmark architectures and image datasets for object classification purpose. The experimental results on classification accuracy show that the proposed method can outperform state-of-the-art network pruning works under various scenarios.

研究动机与目标

  • 通过引入单次剪枝框架,消除通道剪枝中对迭代剪枝与微调的需求。
  • 利用ADMM在训练过程中施加通道级别的稀疏性,实现在滤波器层面的结构化稀疏性。
  • 在标准基准数据集(MNIST、CIFAR-10)和广泛使用的模型架构(LeNet-5、AlexNet)上评估所提方法。
  • 在不同剪枝率下,对比单次剪枝与当前最先进的迭代剪枝方法的性能。
  • 分析ADMM在诱导滤波器级别稀疏性以及剪枝后提升泛化能力方面的有效性。

提出的方法

  • 使用ADMM训练深度卷积神经网络(DCNN),通过增广拉格朗日公式施加通道级别的稀疏性。
  • 通过指示函数 $ g_i(W_i) $ 引入滤波器级别的稀疏性约束,其中 $ \text{card}(W_i) \leq l_i $,$ l_i $ 为每层目标保留滤波器数量。
  • 在ADMM训练后,基于滤波器权重的 $ l_1 $-范数设计启发式剪枝准则,识别并移除重要性最低的滤波器。
  • 剪枝后执行一次微调阶段,以恢复性能下降,使用标准训练流程。
  • 利用ADMM框架迭代更新权重 $ W $、对偶变量 $ Y $ 和辅助变量 $ Z $,通过交替最小化强制约束 $ W = Z $。
  • 将剪枝问题建模为带约束的优化问题:在满足滤波器数量约束下,最小化损失 $ C(W,D) $ 加上稀疏性诱导惩罚 $ \sum g_i(W_i) $。

实验结果

研究问题

  • RQ1ADMM能否在训练过程中有效诱导通道级别的稀疏性,从而实现单次剪枝?
  • RQ2与现有迭代剪枝方法相比,ADMM实现的单次剪枝在准确率和压缩效率方面是否更优?
  • RQ3在ADMM训练过程中,滤波器的 $ l_1 $-范数如何演化?其是否与滤波器重要性相关?
  • RQ4与标准训练相比,ADMM对剪枝后网络的泛化性能有何影响?
  • RQ5所提方法是否能在无需迭代优化的情况下,在高剪枝率下保持高准确率?

主要发现

  • 在CIFAR-10数据集上的AlexNet中,该方法在50%剪枝率下达到77.17%的top-1准确率,显著优于泰勒展开法(TE)的73.06%(无额外微调)和75.47%(有额外微调)。
  • 在75%剪枝率下,该方法准确率达到72.04%,显著优于TE的62.72%(无额外微调)和70.03%(有额外微调)。
  • 在87.5%剪枝率下,该方法保持64.17%的准确率,而TE在无额外微调下为51.83%,有额外微调下为60.92%。
  • ADMM训练导致大量滤波器的 $ l_1 $-范数趋近于零,证实了有效的通道级别稀疏性诱导。
  • 在ADMM训练过程中,深层网络中 $ |W - Z| $ 的距离显著减小,表明不重要的滤波器被有效稀疏化。
  • 尽管预训练的ADMM模型准确率略低,但从ADMM优化模型微调得到的剪枝网络在所有阶段的准确率均持续高于非ADMM基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。