[论文解读] Weight Pruning via Adaptive Sparsity Loss
该论文提出了一种轻量级、端到端的剪枝框架,采用自适应稀疏性损失,在训练过程中实现预算感知的迭代剪枝。通过将层级稀疏性建模为可微分的误差函数,并利用可学习的阈值将其整合到损失函数中,该方法可自动确定每层的最优剪枝水平,在ResNet、Wide ResNet和AlexNet架构上对CIFAR-100和ImageNet数据集均实现了高效率压缩,且精度损失极小。
Pruning neural networks has regained interest in recent years as a means to compress state-of-the-art deep neural networks and enable their deployment on resource-constrained devices. In this paper, we propose a robust compressive learning framework that efficiently prunes network parameters during training with minimal computational overhead. We incorporate fast mechanisms to prune individual layers and build upon these to automatically prune the entire network under a user-defined budget constraint. Key to our end-to-end network pruning approach is the formulation of an intuitive and easy-to-implement adaptive sparsity loss that is used to explicitly control sparsity during training, enabling efficient budget-aware optimization. Extensive experiments demonstrate the effectiveness of the proposed framework for image classification on the CIFAR and ImageNet datasets using different architectures, including AlexNet, ResNets and Wide ResNets.
研究动机与目标
- 为解决在资源受限设备上部署深度神经网络的压缩挑战。
- 克服现有剪枝方法需要多次微调或复杂超参数调优的局限性。
- 开发一种低开销、端到端的剪枝框架,将稀疏性控制直接集成到训练过程中。
- 在用户定义的全局预算约束下,实现自动的、逐层的稀疏性分配。
提出的方法
- 在高斯权重分布假设下,利用误差函数(erf)提出一种可微分的稀疏性公式,实现剪枝阈值的基于梯度的优化。
- 采用直通估计器(STE)实现对剪枝权重的反向传播,支持对先前剪枝连接的动态重新激活。
- 将自适应稀疏性损失建模为可学习的逐层参数,使网络能自动调整稀疏性水平以满足全局预算。
- 使用两种快速的基于幅值的剪枝函数:一种通过二分查找实现,另一种通过置信区间分析实现,以保持每层的目标稀疏性。
- 在训练过程中将任务损失与自适应稀疏性损失相结合,实现精度与稀疏性的联合优化。
- 支持固定剪枝与预算感知剪枝策略,后者可根据冗余程度动态分配各层的稀疏性。
实验结果
研究问题
- RQ1能否设计一种可微分的自适应稀疏性损失,实现在训练过程中端到端、预算感知的剪枝,而无需多次微调?
- RQ2该方法在标准图像分类基准上实现高效率压缩的同时,能否有效保持模型精度?
- RQ3在全局参数量或FLOP预算约束下,该方法能否自动确定最优的逐层稀疏性水平?
- RQ4在精度-压缩权衡方面,自适应稀疏性损失相较于固定稀疏性或无约束剪枝基线方法表现如何?
主要发现
- 在CIFAR-100数据集上使用WRN-16-8模型,该方法实现了85%的整体稀疏性,精度仅比完整模型下降1.2%,表明其具有良好的收敛性与稳定性。
- 在ImageNet数据集上使用AlexNet模型,无约束变体实现了265万参数(压缩率95.7%),Top-1精度达到56.62%,与或优于最先进的非结构化剪枝方法(如BA-FDNP)。
- 在ImageNet数据集上使用ResNet50模型,自适应预算约束变体在70%稀疏性(约750万参数)下,精度优于完整训练的ResNet18基线模型,展现出强大的压缩效率。
- 自适应稀疏性损失实现了自动的逐层稀疏性分配,对冗余性更高的层施加了更高的稀疏性,从而提升了整体压缩效率。
- 与SoA方法(如Ding et al. [70])相比,该方法在精度-压缩权衡方面表现相当或更优,仅在极高稀疏度下性能相近。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。