[论文解读] Differentiable Fine-grained Quantization for Deep Neural Network Compression
本文提出了一种可微分的细粒度量化方法,将离散的位宽选择松弛到连续空间,从而实现通过梯度优化实现深度神经网络中的混合精度量化。通过联合优化各层特定的位宽和网络权重,该方法在仅造成极小精度损失的情况下实现了高达30倍的压缩率,优于相同压缩率下的固定精度基线方法(如8位和二值量化)。
Neural networks have shown great performance in cognitive tasks. When deploying network models on mobile devices with limited resources, weight quantization has been widely adopted. Binary quantization obtains the highest compression but usually results in big accuracy drop. In practice, 8-bit or 16-bit quantization is often used aiming at maintaining the same accuracy as the original 32-bit precision. We observe different layers have different accuracy sensitivity of quantization. Thus judiciously selecting different precision for different layers/structures can potentially produce more efficient models compared to traditional quantization methods by striking a better balance between accuracy and compression rate. In this work, we propose a fine-grained quantization approach for deep neural network compression by relaxing the search space of quantization bitwidth from discrete to a continuous domain. The proposed approach applies gradient descend based optimization to generate a mixed-precision quantization scheme that outperforms the accuracy of traditional quantization methods under the same compression rate.
研究动机与目标
- 为解决固定精度量化在资源受限设备上压缩模型与保持精度之间效率低下的问题。
- 探究基于层的位宽选择是否能相比均匀量化提升精度-压缩权衡。
- 开发一种可微分的搜索机制,实现混合精度量化方案的端到端优化。
- 在保持或提升模型精度的同时,实现高于传统8位或二值量化方法的压缩率。
- 实现高效、可扩展的量化方法,且与现有技术(如权重剪枝)正交。
提出的方法
- 使用基于Softmax的松弛方法,将离散的量化位宽选择(如二值、8位)松弛到连续域,从而支持基于梯度的优化。
- 将每层的量化选择建模为可学习的参数向量α,其中每个元素表示选择特定位宽的概率。
- 采用双层优化框架:在满足验证损失约束L_val(w*, α) ≤ θ的前提下最小化模型大小G(α),其中w*是给定α下的最优训练权重。
- 应用拉格朗日松弛和近似算法求解约束优化问题,通过交替更新α和w实现梯度下降。
- 采用量化操作的可微分松弛,使反向传播能够穿过量化过程,从而实现位宽和网络权重的联合优化。
- 优化完成后,使用学习到的混合精度方案对最终模型进行微调和再训练,以用于推理。
实验结果
研究问题
- RQ1将离散的量化位宽松弛到连续域是否能改善深度神经网络中的精度-压缩权衡?
- RQ2在相同压缩率下,基于层的混合精度量化(不同层使用不同位宽)是否优于均匀量化?
- RQ3基于梯度的优化能否有效搜索最优混合精度配置,而无需依赖离散搜索启发式方法?
- RQ4与固定精度基线(如8位、二值量化)相比,所提方法在压缩率和精度方面表现如何?
- RQ5该方法在多大程度上可与其它压缩技术(如权重剪枝)结合使用?
主要发现
- 在MNIST上,该方法实现了28倍压缩,精度仅下降0.46%(精度达98.20%),优于8位(98.48%)和二值量化(96.34%)基线在更高压缩率下的表现。
- 在CIFAR-10上使用VGG-16,该方法实现了30倍压缩,精度达83.06%,优于二值量化(81.56%),且压缩率几乎相同。
- 在保持接近32倍压缩率的同时,相比二值量化,精度提升了1.5%。
- 内存消耗显著降低,尤其在中间层,如图2所示,混合精度模型明显比全精度的VGG-16更窄。
- 该方法与权重剪枝正交,可与最先进的剪枝技术结合,实现高达900倍的整体压缩率。
- 该方法具有良好的泛化能力,适用于多种网络架构,不仅限于CNN,还可扩展至RNN和LSTM。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。