[论文解读] Convolutional Neural Network Quantization using Generalized Gamma Distribution
本文提出了一种用于卷积神经网络(CNNs)的新型量化方法,该方法利用广义伽马分布(GGD)对特征图激活进行建模,并优化量化步长以实现最大信号-量化噪声比(SQNR)。该方法通过分数长度选择分别优化权重和偏置,并应用反向-前向调优(BFT)过程进一步提升精度,在GoogLeNet、AlexNet和VGG-16等模型上实现了低精度推理下的近浮点精度表现。
As edge applications using convolutional neural networks (CNN) models grow, it is becoming necessary to introduce dedicated hardware accelerators in which network parameters and feature-map data are represented with limited precision. In this paper we propose a novel quantization algorithm for energy-efficient deployment of the hardware accelerators. For weights and biases, the optimal bit length of the fractional part is determined so that the quantization error is minimized over their distribution. For feature-map data, meanwhile, their sample distribution is well approximated with the generalized gamma distribution (GGD), and accordingly the optimal quantization step size can be obtained through the asymptotical closed form solution of GGD. The proposed quantization algorithm has a higher signal-to-quantization-noise ratio (SQNR) than other quantization schemes previously proposed for CNNs, and even can be more improved by tuning the quantization parameters, resulting in efficient implementation of the hardware accelerators for CNNs in terms of power consumption and memory bandwidth.
研究动机与目标
- 为在功耗和内存带宽受限的边缘设备上部署低精度CNN提供解决方案。
- 在无需微调的情况下最小化权重、偏置和特征图的量化误差。
- 开发一种硬件友好的量化方案,在最大化SQNR的同时保持高推理精度。
- 通过优化比特宽度分配和量化参数调优,实现CNN加速器的高效部署。
提出的方法
- 利用广义伽马分布(GGD)对CNN各层的特征图分布进行建模,从而实现最优量化步长的渐近闭式推导。
- 通过最小化权重和偏置经验分布上的均方量化误差,优化其分数长度。
- 应用反向-前向调优(BFT)算法在量化后微调量化参数,提升精度而无需重新训练。
- 采用两阶段流程:第一阶段为权重和特征图的SQNR最大化量化;第二阶段通过BFT使量化与实际网络性能对齐。
- 采用非均匀量化策略,根据各层权重和激活分布的统计特性进行定制化处理。
- 支持混合精度量化,允许对权重和特征图使用不同比特宽度(例如w8/fm4),实现精度与资源消耗之间的权衡。
实验结果
研究问题
- RQ1广义伽马分布(GGD)能否准确建模CNN各层中特征图激活的统计分布?
- RQ2基于GGD的量化方法是否在CNN特征图上实现的SQNR高于均匀量化或其他基于分布的量化方案?
- RQ3反向-前向调优(BFT)是否能在不重新训练的情况下有效提升量化后的推理精度?
- RQ4在低比特宽度下,该方法与以往量化方案相比,在精度和能效方面表现如何?
主要发现
- 在GoogLeNet上,使用8位权重和4位特征图时,该方法实现了68.6%的Top-1精度,仅比浮点精度低4.4%。
- 当使用6位权重和6位特征图时,该方法在GoogLeNet上实现了66.7%的Top-1精度,表现出在低比特宽度下的优异性能。
- 在AlexNet上,使用8位权重和4位特征图时,该方法实现了56.2%的Top-1精度,与浮点基准相比仅相差0.6%。
- 在VGG-16上,使用8位权重和4位特征图时,该方法实现了68.3%的Top-1精度,与浮点基准完全一致。
- BFT调优步骤可使精度相比基线量化提升最高达1.9%,证明其在弥合SQNR与精度差距方面的有效性。
- 在6位和8位精度下,该方法在精度损失方面优于Ristretto和QNN,当使用8位权重和4位特征图时,精度损失仅为0.3%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。