[论文解读] Rethinking Class-Discrimination Based CNN Channel Pruning
本文提出了一种新颖的通道剪枝方法,重新评估了用于CNN剪枝的类别判别度量,引入了一种广义对称散度(G-SD)度量,其在选择信息性通道方面优于现有方法。通过将G-SD与FLOP归一化的敏感性分析相结合,该方法在ImageNet上实现了44.3%的FLOPs减少,同时在ResNet-50上仅造成0.3%的top-1准确率下降,达到当前最优性能。
Channel pruning has received ever-increasing focus on network compression. In particular, class-discrimination based channel pruning has made major headway, as it fits seamlessly with the classification objective of CNNs and provides good explainability. Prior works singly propose and evaluate their discriminant functions, while further study on the effectiveness of the adopted metrics is absent. To this end, we initiate the first study on the effectiveness of a broad range of discriminant functions on channel pruning. Conventional single-variate binary-class statistics like Student's T-Test are also included in our study via an intuitive generalization. The winning metric of our study has a greater ability to select informative channels over other state-of-the-art methods, which is substantiated by our qualitative and quantitative analysis. Moreover, we develop a FLOP-normalized sensitivity analysis scheme to automate the structural pruning procedure. On CIFAR-10, CIFAR-100, and ILSVRC-2012 datasets, our pruned models achieve higher accuracy with less inference cost compared to state-of-the-art results. For example, on ILSVRC-2012, our 44.3% FLOPs-pruned ResNet-50 has only a 0.3% top-1 accuracy drop, which significantly outperforms the state of the art.
研究动机与目标
- 研究一系列类别判别函数在CNN通道剪枝中的有效性,包括高维统计量与单变量统计量。
- 以轻量化且直观的方式,将单变量二分类统计量(如Student’s T-Test)推广至多分类、高维通道评分。
- 提出一种FLOP归一化的敏感性分析方案,用于实现自动化的跨层剪枝决策,公平比较各层之间的冗余性。
- 在CIFAR-10、CIFAR-100和ILSVRC-2012等标准基准上,实现SOTA模型压缩,且准确率损失最小。
提出的方法
- 将单变量二分类统计量(如Student’s T-Test)推广为高维多分类通道评分函数,提出广义对称散度(G-SD)。
- 利用G-SD根据通道的类别判别能力对通道进行排序,选择激活特征在不同类别间可分性更高的通道。
- 提出一种FLOP归一化的敏感性分析方法,用于在相同FLOPs减少条件下评估各层的剪枝敏感性,实现自动化的逐层剪枝决策。
- 将G-SD与FLOP归一化的敏感性分析整合至统一的剪枝流程中,实现无需微调即可选择通道并确定剪枝比例。
- 将该方法应用于VGGNet与ResNet架构,在CIFAR-10、CIFAR-100与ILSVRC-2012上进行评估,分析准确率与FLOPs减少情况。
- 通过有无微调的消融实验,分离通道选择质量与微调带来的影响。
实验结果
研究问题
- RQ1各类类别判别度量(包括广义单变量统计量与高维函数)在CNN通道剪枝中的有效性如何?
- RQ2能否有意义地将单变量二分类统计量(如Student’s T-Test)推广至CNN中多分类、高维通道评分?
- RQ3所提出的FLOP归一化敏感性分析是否相比传统方法能实现更准确、更自动化的跨层剪枝决策?
- RQ4通道选择质量(独立于微调影响)对最终剪枝模型准确率的影响如何?
- RQ5所提方法是否能在多样化的基准上实现SOTA的准确率与FLOPs减少表现?
主要发现
- 广义对称散度(G-SD)度量在选择信息性通道方面显著优于其他判别函数,包括MMD与先前方法。
- 在ILSVRC-2012上,剪枝后的ResNet-50在实现44.3% FLOPs减少的同时,top-1准确率达到75.85%,仅造成0.3%的准确率下降,超越现有SOTA方法。
- 在未微调的情况下,G-SD在VGG-16(ImageNet)与ResNet-110(CIFAR-10)上于所有FLOPs减少比例下均保持更高准确率,证明其通道选择质量更优。
- FLOP归一化的敏感性分析实现了无性能下降的准确剪枝,相比Li的方法造成0.3%准确率损失,而本方法实现无损失。
- 定性分析表明,G-SD选择的通道具有更清晰的类别可分性与更具判别性的特征模式,优于ℓ1-范数、批量归一化缩放与几何中位数。
- 在相同FLOPs减少比例下,本方法相比GAL [36] 实现4%的top-1准确率增益,同时提供更高的加速比。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。