[论文解读] Neural Network Pruning with Residual-Connections and Limited-Data
该论文提出CURL,一种新颖的逐滤波器剪枝方法,通过基于KL散度的准则,同时剪枝残差连接内部和外部的通道,从而实现更高效的“钱包形”网络结构。此外,通过结合知识蒸馏与标签精炼,缓解了噪声软标签的影响,解决了小样本数据下的剪枝问题,即使仅在CUB200和Pets等小规模数据集上训练,其性能仍可与在大规模预训练模型上微调的模型相媲美或更优。
Filter level pruning is an effective method to accelerate the inference speed of deep CNN models. Although numerous pruning algorithms have been proposed, there are still two open issues. The first problem is how to prune residual connections. We propose to prune both channels inside and outside the residual connections via a KL-divergence based criterion. The second issue is pruning with limited data. We observe an interesting phenomenon: directly pruning on a small dataset is usually worse than fine-tuning a small model which is pruned or trained from scratch on the large dataset. Knowledge distillation is an effective approach to compensate for the weakness of limited data. However, the logits of a teacher model may be noisy. In order to avoid the influence of label noise, we propose a label refinement approach to solve this problem. Experiments have demonstrated the effectiveness of our method (CURL, Compression Using Residual-connections and Limited-data). CURL significantly outperforms previous state-of-the-art methods on ImageNet. More importantly, when pruning on small datasets, CURL achieves comparable or much better performance than fine-tuning a pretrained small model.
研究动机与目标
- 为解决深度卷积神经网络中剪枝残差连接所导致的性能下降问题,避免形成性能降低的‘沙漏’结构。
- 在训练数据有限的现实场景下提升模型精度,此类场景中大规模数据集通常不可用。
- 减少对大规模预训练的依赖,实现在小目标数据集上直接剪枝,同时保持高精度。
- 缓解知识蒸馏过程中在小样本数据集上微调时,由噪声软标签带来的负面影响。
提出的方法
- 基于KL散度的准则用于评估残差分支与恒等分支中滤波器的重要性,实现对残差连接内部和外部通道的联合剪枝。
- 在残差块阶段内,对所有块同时应用剪枝操作,以保持残差连接的结构完整性。
- 通过mixup数据增强技术扩展小样本数据集,提升训练多样性与模型鲁棒性。
- 在知识蒸馏过程中引入标签精炼策略,动态更新软标签,以降低教师模型预测中噪声的影响。
- 将知识蒸馏与数据增强及标签精炼相结合,提升在有限数据下的模型性能。
- 该方法端到端应用,允许直接在小样本数据集上进行剪枝,无需访问大规模预训练数据。
实验结果
研究问题
- RQ1与仅剪枝残差路径内滤波器的传统剪枝方法相比,能否通过同时剪枝残差连接内部和外部的滤波器,提升模型效率与精度?
- RQ2如何增强知识蒸馏,以降低在小样本数据集上微调时噪声软标签的影响?
- RQ3在低数据场景下,将数据增强与知识蒸馏及标签精炼相结合,是否能带来优于标准蒸馏的性能提升?
- RQ4在小样本数据集上直接训练的剪枝模型,能否实现与在大规模数据集上预训练后微调的模型相当或更优的性能?
主要发现
- 在ImageNet上,CURL优于以往的SOTA剪枝方法,展现出更优的精度与效率,其‘钱包形’残差块结构表现突出。
- 在CUB200上,所提出的KL散度准则在不进行微调的情况下实现66.33%的top-1精度,显著优于随机剪枝(6.80%)与权重和剪枝(8.25%)基线。
- 通过标签精炼,MobileNetV2在CUB200上达到78.72%的top-1精度,较无精炼的标准知识蒸馏方法提升1.29%。
- 在小样本数据集上使用CURL微调ResNet50,CUB200上的准确率达到83.64%,超过标准蒸馏方法的82.88%。
- 在Dogs数据集上,标签精炼方法最高使准确率提升0.84%,证明其有效降低了标签噪声的影响。
- mixup、知识蒸馏与标签精炼的结合,使直接在小样本数据集上剪枝的模型性能达到或超越在ImageNet上预训练后微调的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。