[论文解读] SS-Auto: A Single-Shot, Automatic Structured Weight Pruning Framework of DNNs with Ultra-High Efficiency
SS-Auto 是一种用于深度神经网络(DNNs)的单次、自动结构化剪枝框架,通过基于软约束的交替方向乘子法(ADMM)公式化,联合优化通道和通道的剪枝,采用原始-近端(Primal-Proximal)求解方法,实现了极高的压缩率(在 VGG-16 上最高达 41.1×),同时保持了极小的精度损失,并在移动设备上实现了显著的推理加速。
Structured weight pruning is a representative model compression technique of DNNs for hardware efficiency and inference accelerations. Previous works in this area leave great space for improvement since sparse structures with combinations of different structured pruning schemes are not exploited fully and efficiently. To mitigate the limitations, we propose SS-Auto, a single-shot, automatic structured pruning framework that can achieve row pruning and column pruning simultaneously. We adopt soft constraint-based formulation to alleviate the strong non-convexity of l0-norm constraints used in state-of-the-art ADMM-based methods for faster convergence and fewer hyperparameters. Instead of solving the problem directly, a Primal-Proximal solution is proposed to avoid the pitfall of penalizing all weights equally, thereby enhancing the accuracy. Extensive experiments on CIFAR-10 and CIFAR-100 datasets demonstrate that the proposed framework can achieve ultra-high pruning rates while maintaining accuracy. Furthermore, significant inference speedup has been observed from the proposed framework through actual measurements on the smartphone.
研究动机与目标
- 解决现有基于 ADMM 的结构化剪枝方法依赖于高度非凸的 ℓ₀-范数硬约束以及过多超参数的问题。
- 实现通道和通道的并行剪枝,以探索更丰富的稀疏结构并提升压缩效率。
- 自动化每层的剪枝率确定,避免手动调整超参数和次优配置。
- 通过原始-近端方法将梯度下降与正则化解耦,提升剪枝过程中的模型精度。
- 在保持极小精度损失的同时实现超高压缩率,并在移动平台实现可测量的推理加速。
提出的方法
- 采用基于软约束的公式化方法,替代 ADMM 中强非凸的 ℓ₀-范数硬约束,降低收敛时间与对超参数的敏感性。
- 引入原始-近端求解方法,将随机梯度下降与正则化过程解耦,实现对不重要权重的渐进式惩罚降低。
- 在单次优化过程中同时优化通道和通道的稀疏性,实现滤波器与通道的联合剪枝。
- 通过优化过程自动推导每层的剪枝率,消除人工调参。
- 利用编译器辅助的移动 DNN 加速框架,在智能手机上测量实际推理加速效果。
- 采用基于 ADMM 的优化方法,结合近端更新,高效求解结构化剪枝问题,同时保持模型精度。
实验结果
研究问题
- RQ1是否能够设计一种单次、自动的结构化剪枝框架,联合优化通道和通道剪枝,从而实现高于现有方法的压缩率?
- RQ2在 ADMM 中用软约束替代硬约束 ℓ₀-范数,是否能提升收敛速度并降低对超参数的敏感性?
- RQ3原始-近端求解方法是否能通过动态调整惩罚权重,提升模型精度?
- RQ4自动化的每层剪枝率确定方法,能否优于手动或迭代式超参数搜索?
- RQ5在实际移动设备上,使用该框架能实现多大程度的推理加速?
主要发现
- 在 CIFAR-10 上,SS-Auto 对 VGG-16 实现了 41.1× 的压缩率,精度仅下降 0.1%,优于先前方法。
- 在 ResNet-18 上,SS-Auto 达到 24.6× 压缩率,精度为 94.2%,优于 AutoCompress(18.5×)和 ADMM(15.1×)方法。
- 在 MobileNet-V2 上,SS-Auto 实现了 7.5× 压缩率且精度无损失,表明其在不同网络架构间具有强大的泛化能力。
- 在 CIFAR-10 上,SS-Auto 将 ResNet-18 的推理时间分别缩短至 CPU 上的 3.28ms 和 GPU 上的 3.39ms,显示出在移动平台上的显著加速效果。
- 原始-近端求解方法通过自适应惩罚调度策略,保留了关键权重,从而实现更精确的剪枝。
- 在移动设备上实测的推理加速效果验证了剪枝模型的硬件效率,尤其在高倍压缩率下表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。