[论文解读] Weight Normalization based Quantization for Deep Neural Network Compression
本文提出了一种名为加权归一化量化(WNQ)的新方法,通过在量化前对深度神经网络的权重进行归一化,以缓解权重的长尾分布问题,从而降低量化误差。WNQ在CIFAR-100和ImageNet上实现了最先进性能,尤其在低比特宽度(2比特和3比特)下显著优于现有方法如LQ-Net和QIL,通过大幅降低相对均方量化误差,实现了更优的性能。
With the development of deep neural networks, the size of network models becomes larger and larger. Model compression has become an urgent need for deploying these network models to mobile or embedded devices. Model quantization is a representative model compression technique. Although a lot of quantization methods have been proposed, many of them suffer from a high quantization error caused by a long-tail distribution of network weights. In this paper, we propose a novel quantization method, called weight normalization based quantization (WNQ), for model compression. WNQ adopts weight normalization to avoid the long-tail distribution of network weights and subsequently reduces the quantization error. Experiments on CIFAR-100 and ImageNet show that WNQ can outperform other baselines to achieve state-of-the-art performance.
研究动机与目标
- 解决因权重长尾分布导致的低比特DNN量化中高量化误差的问题。
- 通过加权归一化最小化量化误差,提升模型压缩性能。
- 探索权重分布对量化准确率的影响,这一因素在以往的模型量化研究中尚未被充分探讨。
- 在不牺牲模型准确率的前提下,实现在低比特权重量化中的最先进性能。
提出的方法
- WNQ在量化前对每个卷积核应用加权归一化,以改善权重分布,减轻长尾效应。
- 按卷积核而非按层进行权重量化,从而实现更精确和稳定的量化。
- 采用标准量化函数,并引入可学习的缩放和偏移参数,其中缩放参数由归一化后权重的L2范数推导得出。
- 在训练过程中应用加权归一化,推理时使用量化后的权重,仅造成极小的准确率下降。
- 该方法与现有量化框架兼容,可与激活量化结合使用。
- 采用相对均方量化误差(mse)作为度量指标,用于比较不同方法的分布稳定性。
实验结果
研究问题
- RQ1网络权重的长尾分布在低比特DNN中如何影响量化误差?
- RQ2加权归一化是否能通过平滑权重分布有效降低量化误差?
- RQ3在低比特设置下,WNQ是否能超越现有最先进量化方法(如LQ-Net和QIL)?
- RQ4在对所有层(包括首层和末层)进行量化时,WNQ是否能保持高准确率,而无需像以往方法那样排除这些层?
- RQ5不同层中,权重分布对相对均方量化误差有何影响?
主要发现
- 在3比特量化下,WNQ在ImageNet上实现了0.24的Top1差距,优于LQ-Net(0.38差距)和QIL(0.30差距),且所有层均被量化。
- 在CIFAR-100上,WNQ将3比特量化下的Top1差距降低至0.39,而LQ-Net为0.66,表明量化误差更低。
- 在ResNet18上,WNQ在2比特下实现0.03的Top1差距,显著优于LQ-Net的0.28差距。
- 在最后一个全连接层中,WNQ的相对均方量化误差(mse)比LQ-Net低5.29倍,证实了量化误差的降低。
- WNQ的权重分布比LQ-Net更平滑,长尾现象更弱,尤其在最后一层,这与性能提升密切相关。
- 在MobileNetv1上,WNQ相较于LQ-Net在2比特下提升Top1准确率1.24%,在3比特下提升2.06%,表明其在多种架构上均保持一致的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。