[论文解读] Focused Quantization for Sparse CNNs
本文提出聚焦量化(FQ),一种用于稀疏卷积神经网络的混合量化方法,通过基于层特定权重分布动态结合移位量化与再中心化量化,实现高效压缩。利用剪枝模型的统计特性,FQ在实现18.08×压缩比(ResNet-50)的同时仅造成0.24%的top-5准确率下降,且通过位移操作实现高效推理并减少硬件资源占用。
Deep convolutional neural networks (CNNs) are powerful tools for a wide range of vision tasks, but the enormous amount of memory and compute resources required by CNNs pose a challenge in deploying them on constrained devices. Existing compression techniques, while excelling at reducing model sizes, struggle to be computationally friendly. In this paper, we attend to the statistical properties of sparse CNNs and present focused quantization, a novel quantization strategy based on power-of-two values, which exploits the weight distributions after fine-grained pruning. The proposed method dynamically discovers the most effective numerical representation for weights in layers with varying sparsities, significantly reducing model sizes. Multiplications in quantized CNNs are replaced with much cheaper bit-shift operations for efficient inference. Coupled with lossless encoding, we built a compression pipeline that provides CNNs with high compression ratios (CR), low computation cost and minimal loss in accuracy. In ResNet-50, we achieved a 18.08x CR with only 0.24% loss in top-5 accuracy, outperforming existing compression methods. We fully compressed a ResNet-18 and found that it is not only higher in CR and top-5 accuracy, but also more hardware efficient as it requires fewer logic gates to implement when compared to other state-of-the-art quantization methods assuming the same throughput.
研究动机与目标
- 为解决标准量化在稀疏CNN中效率低下的问题,即在细粒度剪枝后因权重分布非均匀,导致统一或对数量化级别利用率低下。
- 开发一种能适应各层不同稀疏度的量化策略,最大化量化级别利用率并最小化计算开销。
- 构建一个完整的压缩流水线,集成剪枝、聚焦量化与无损编码,以实现高压缩比与低硬件成本。
- 证明FQ相比当前最先进量化方法可实现更高效的硬件实现,所需逻辑门更少、资源占用更低。
提出的方法
- FQ使用高斯混合模型识别剪枝层权重分布中的高概率区域,实现针对性量化。
- 对于存在多个集中权重簇的层,FQ应用再中心化量化,将每个簇映射到一组2的幂次值以实现精细表示。
- 对于具有单一主导权重簇的层,FQ采用基于2的幂次值的移位量化,以在推理过程中实现高效的位移操作。
- 通过高斯分量之间的Wasserstein距离度量决定每层使用再中心化或移位量化,实验中采用wsep = 2.0作为阈值。
- 在推理过程中,将缩放因子融合进批归一化层,消除额外乘法运算,降低硬件复杂度。
- 完整流水线包括细粒度剪枝、FQ与Huffman编码,实现高压缩比且准确率损失最小。
实验结果
研究问题
- RQ1在细粒度剪枝后权重分布偏斜且非均匀的稀疏CNN中,如何使量化更有效?
- RQ2结合移位与再中心化量化的混合量化策略是否能在压缩效率与硬件成本方面优于标准量化?
- RQ3何种度量可可靠判断基于层特定稀疏度与权重分布,何时切换至移位或再中心化量化?
- RQ4聚焦量化在现代CNN中能在多大程度上减小模型大小与计算成本,同时保持模型准确率?
- RQ5FQ硬件设计在逻辑门使用与资源效率方面与当前最先进量化方法相比如何?
主要发现
- 在ResNet-50中,聚焦量化实现了18.08×的压缩比,仅造成0.24%的top-5准确率下降,优于现有方法。
- 使用FQ的全量化ResNet-18模型在压缩比与top-5准确率上均优于LQ-Net与ABC-Net,且所需逻辑门更少。
- 基于FQ的硬件加速器展现出更优的硬件效率,尽管具有更多量化级别与更高压缩比,其使用的逻辑门数量仍少于ABC-Net与LQ-Net。
- 采用Wasserstein距离阈值(wsep = 2.0)能有效区分需使用再中心化或移位量化的层,提升量化利用率。
- 包含剪枝、量化与Huffman编码的FQ流水线实现了高精度损失最小的高压缩比,适用于边缘与物联网设备。
- FQ仅使用2的幂次值,支持高效位移操作,显著降低推理阶段的计算成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。