[论文解读] Convolution-Weight-Distribution Assumption: Rethinking the Criteria of Channel Pruning
本文通过识别卷积神经网络中现有通道剪枝标准的两个关键盲点,挑战了当前主流的剪枝准则:一是常用准则(如 ℓ₁、ℓ₂、Fermat)之间高度相似,导致剪枝结构几乎完全相同;二是由于滤波器重要性得分区分度不足,导致准则适用性差。作者提出了卷积权值分布假设——即训练良好的滤波器近似服从高斯分布——并通过实证验证表明,该假设能够支持更有效且更具差异性的剪枝准则。
Channel pruning is a popular technique for compressing convolutional neural networks (CNNs), where various pruning criteria have been proposed to remove the redundant filters. From our comprehensive experiments, we found two blind spots in the study of pruning criteria: (1) Similarity: There are some strong similarities among several primary pruning criteria that are widely cited and compared. According to these criteria, the ranks of filters'Importance Score are almost identical, resulting in similar pruned structures. (2) Applicability: The filters'Importance Score measured by some pruning criteria are too close to distinguish the network redundancy well. In this paper, we analyze these two blind spots on different types of pruning criteria with layer-wise pruning or global pruning. The analyses are based on the empirical experiments and our assumption (Convolutional Weight Distribution Assumption) that the well-trained convolutional filters each layer approximately follow a Gaussian-alike distribution. This assumption has been verified through systematic and extensive statistical tests.
研究动机与目标
- 识别并分析现有通道剪枝准则中的两个主要盲点:准则之间高度相似,以及因重要性得分区分度不足导致的适用性差。
- 挑战广泛持有的观点,即 ℓ₁ 和 ℓ₂ 剪枝相似,证明在所提出的分布假设下,二者可能表现出显著差异。
- 基于对滤波器权值分布呈高斯类似特性的实证验证,建立新的理论基础——卷积权值分布假设。
- 通过基于分布的重要性评分方法改进剪枝准则,实现更高效且更具差异性的模型压缩。
- 证明当前准则通常产生几乎相同的剪枝模型,从而削弱了剪枝研究中国方法多样性的价值。
提出的方法
- 提出卷积权值分布假设:每个卷积层中训练良好的卷积滤波器近似服从高斯分布。
- 通过在多种模型(VGG16、ResNet18、DenseNet 等)和数据集(ImageNet、CIFAR、Cityscapes 等)上进行广泛统计检验,验证该假设。
- 通过比较不同准则(ℓ₁、ℓ₂、Fermat、GM)在多个模型上滤波器重要性得分的排序,分析剪枝准则之间的相似性。
- 通过可视化各层重要性得分的分布,研究其适用性,揭示得分高度重叠且区分度差。
- 采用逐层与全局剪枝策略,在一致的训练与微调协议下评估不同准则的影响。
- 在多种架构、初始化方法、归一化方案和任务上进行消融实验,以评估所提假设的鲁棒性与泛化能力。
实验结果
研究问题
- RQ1在实践中,广泛使用的剪枝准则(如 ℓ₁、ℓ₂、Fermat、GM)在多大程度上会产生不同的剪枝结构?
- RQ2为何尽管理论基础不同,许多剪枝准则仍会产生几乎相同的滤波器剪枝顺序?
- RQ3滤波器权值服从高斯类似分布的假设,在多样化的CNN架构和数据集上成立程度如何?
- RQ4与现有准则相比,所提出的分布假设能否带来更有效且更具差异性的剪枝结果?
- RQ5滤波器重要性得分区分度差,对通道剪枝有效性有何影响?
主要发现
- 在 VGG16 和 ResNet18 等模型中,ℓ₁、ℓ₂、Fermat 和 GM 准则下的滤波器重要性得分排名几乎完全一致,表明剪枝结构具有高度相似性。
- 来自多种准则(如 BN_γ、Taylor ℓ₂、ℓ₂)的重要得分在各层中数值过于接近,难以区分冗余滤波器,凸显了适用性盲点。
- 实证验证表明,训练良好的卷积滤波器在超过15种模型和10余种数据集上均呈现高斯类似分布,支持卷积权值分布假设。
- 该假设使剪枝方法更具原则性和有效性,因为它揭示了当前准则往往未能利用训练滤波器内在的统计结构。
- 即使简单的准则如 ℓ₁ 和 ℓ₂ 也并非总是表现相似,这与普遍假设相悖,表明相对重要性比绝对范数更为关键。
- 该假设在多种设置下均成立:不同的初始化方式(Xavier、Kaiming、正交)、归一化类型(BatchNorm、无BN)以及任务(分类、分割、GAN、风格迁移),在大多数情况下成功率超过95%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。