[论文解读] A Unified DNN Weight Compression Framework Using Reweighted Optimization Methods
该论文提出了一种统一的DNN权重重剪枝框架,采用重加权优化以实现高精度、高比率的结构化与非结构化稀疏性,并具备自动超参数调优能力。通过用动态更新的重加权 $¹$ 正则化替代ADMM的硬 $ε$-范数约束,该方法加速了收敛,将训练时间从150个周期减少至85个周期,并在ResNet-18上实现了4.2×的结构化剪枝,top-5准确率达到88.5%,优于当前最先进的ADMM方法。
To address the large model size and intensive computation requirement of deep neural networks (DNNs), weight pruning techniques have been proposed and generally fall into two categories, i.e., static regularization-based pruning and dynamic regularization-based pruning. However, the former method currently suffers either complex workloads or accuracy degradation, while the latter one takes a long time to tune the parameters to achieve the desired pruning rate without accuracy loss. In this paper, we propose a unified DNN weight pruning framework with dynamically updated regularization terms bounded by the designated constraint, which can generate both non-structured sparsity and different kinds of structured sparsity. We also extend our method to an integrated framework for the combination of different DNN compression tasks.
研究动机与目标
- 解决基于静态与动态正则化的DNN剪枝方法的局限性,包括精度下降和收敛时间过长的问题。
- 在单一优化框架下统一非结构化与结构化稀疏性的生成,同时降低对超参数的敏感性。
- 通过用重加权 $¹$ 正则化替代非凸的 $ε$-范数约束,加速收敛并减少训练时间。
- 通过动态正则化实现每层剪枝率的自动确定,消除手动调参的需要。
- 将该框架扩展至集成压缩任务,例如结合剪枝与量化。
提出的方法
- 该方法使用重加权 $¹$ 正则化作为难以处理的 $ε$-范数稀疏性约束的代理,以实现高效的优化。
- 基于当前权重大小动态更新重加权系数,逐步识别并剪除重要性较低的权重。
- 低于阈值的权重被屏蔽,不再参与梯度更新并被永久移除,而剩余权重则通过微调恢复精度。
- 该框架通过带重加权正则化的组Lasso支持非结构化稀疏性以及多种结构化稀疏性模式。
- 在多任务压缩中,该方法结合ADMM的硬约束(如模式剪枝)与重加权正则化(如权重量化),实现协同优化。
- 该方法避免了 $ε$-范数约束带来的强非凸性,从而实现比ADMM更快的收敛速度和更少的超参数。
实验结果
研究问题
- RQ1重加权 $¹$ 正则化是否能在剪枝率和收敛速度方面优于基于ADMM的硬约束?
- RQ2统一框架是否能以最少的超参数调优实现非结构化与结构化稀疏性的生成?
- RQ3将重加权正则化与ADMM结合用于多任务压缩,是否能获得比对两个任务均使用ADMM更高的总压缩率?
- RQ4该方法是否能自动确定每层的剪枝率而无需手动配置?
- RQ5与基于大小和 $¹$-范数的剪枝方法相比,该方法在精度和压缩效率方面表现如何?
主要发现
- 所提方法在ImageNet数据集上的ResNet-18上实现了4.2×的结构化剪枝,top-5准确率达到88.5%,优于当前最先进的ADMM方法(3.0×,87.9%准确率)。
- 使用单一惩罚参数,训练时间从ADMM的150个周期减少至85个周期,消除了对每层超参数调优的需求。
- 在MNIST数据集上的LeNet-5上,该方法实现了1014×的总压缩率,仅损失0.2%精度,优于ADMM-NN的623×压缩率。
- 在ImageNet数据集上的AlexNet上,该方法实现了115×的总压缩率,仅损失0.2%精度,超过ADMM-NN的99×压缩率。
- 在CIFAR-10数据集上对VGG-16进行联合模式与通道级剪枝时,该方法实现了34.9×的剪枝率(比PCONV高1.76倍);在ImageNet上实现了13.1×的剪枝率(比PCONV高1.87倍)。
- 重加权正则化框架实现了每层剪枝率的自动确定,显著降低了对启发式超参数选择的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。