[论文解读] BLK-REW: A Unified Block-based DNN Pruning Framework using Reweighted Regularization Method
本文提出BLK-REW,一种统一的基于块的DNN剪枝框架,采用重加权组Lasso正则化方法,实现对CNN和RNN的结构化剪枝。通过引入灵活的分块结构稀疏性及高效的重加权机制,BLK-REW在实现极高压缩率的同时保持极低的精度损失,并通过集成编译器优化实现移动设备上的实时推理。
Accelerating DNN execution on various resource-limited computing platforms has been a long-standing problem. Prior works utilize l1-based group lasso or dynamic regularization such as ADMM to perform structured pruning on DNN models to leverage the parallel computing architectures. However, both of the pruning dimensions and pruning methods lack universality, which leads to degraded performance and limited applicability. To solve the problem, we propose a new block-based pruning framework that comprises a general and flexible structured pruning dimension as well as a powerful and efficient reweighted regularization method. Our framework is universal, which can be applied to both CNNs and RNNs, implying complete support for the two major kinds of computation-intensive layers (i.e., CONV and FC layers). To complete all aspects of the pruning-for-acceleration task, we also integrate compiler-based code optimization into our framework that can perform DNN inference in a real-time manner. To the best of our knowledge, it is the first time that the weight pruning framework achieves universal coverage for both CNNs and RNNs with real-time mobile acceleration and no accuracy compromise.
研究动机与目标
- 解决现有结构化剪枝方法缺乏通用性的问题,这些方法通常仅适用于特定网络类型(如CNNs)。
- 克服基于ADMM的剪枝方法在性能上不理想且收敛时间长的问题,尤其针对RNN中的全连接层。
- 开发一种灵活的剪枝维度,支持CNN和RNN,且不造成精度下降。
- 集成基于编译器的代码优化,以实现在资源受限的移动平台上的实时推理。
- 通过动态、高效的正则化方法,实现高模型压缩率并保持最小精度损失。
提出的方法
- 提出基于块的结构化剪枝(BLK剪枝),将DNN层划分为可变大小的块,并对每个块独立应用结构化剪枝,以提升设计灵活性。
- 采用重加权组Lasso正则化方法,根据权重大小动态调整正则化强度,实现更精确、高效的稀疏性诱导。
- 使用迭代更新的重加权方案,聚焦于不重要的权重,从而提升收敛速度与剪枝质量。
- 集成基于编译器的代码生成与优化(如Winograd、TFLite、TVM),以加速移动CPU和GPU上的推理。
- 在CNN(如VGG-16、ResNet-18)和RNN(如TIMIT上的GRU)上端到端应用该框架,支持卷积层与全连接层。
- 采用统一的训练流程,将分块稀疏性约束与重加权正则化相结合,联合优化压缩率与精度。
实验结果
研究问题
- RQ1统一的剪枝框架是否能在CNN和RNN上均实现高精度压缩与实时推理?
- RQ2重加权正则化是否在剪枝质量与收敛速度上优于传统的L1-组Lasso和ADMM方法?
- RQ3基于块的结构化稀疏性是否能在保持高精度的同时,实现硬件兼容且高效的移动设备推理?
- RQ4编译器级别优化的集成如何影响剪枝模型的推理延迟?
- RQ5该框架是否能在不损害模型精度的前提下实现最先进的压缩率?
主要发现
- 在VGG-16上,BLK-REW实现了28.5×的压缩率,top-1精度达94.0%,精度与非结构化剪枝相当或更优,同时保持硬件兼容性。
- 在ResNet-18上,该框架实现了7.6×的压缩率,top-1精度为69.0%,保留了原始模型98.5%的性能。
- 在MobileNet-V2上,BLK-REW实现了10.3×的压缩率,top-1精度达94.5%,展现出在高效架构上的强大泛化能力。
- 在基于GRU的语音识别任务中,框架实现了231.3×的压缩率,测试误差率为18.8%,在移动GPU上实现0.21ms的推理延迟,支持实时推理。
- 在移动CPU/GPU上,图像分类任务的推理延迟低于33ms,满足实时性要求(如30fps视频)。
- 重加权正则化方法相比ADMM收敛速度快得多,且在全连接层中生成的稀疏模式优于L1-组Lasso。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。