[论文解读] Intra-layer Nonuniform Quantization for Deep Convolutional Neural Network
本文提出了一种层内非均匀量化方案——等距非均匀量化(ENQ)与基于K均值聚类的非均匀量化(KNQ),通过利用激活分布特性来减少深度卷积神经网络(DCNN)的内存存储需求。KNQ方案在VGG-16和AlexNet上实现了高达50%的内存压缩,且精度损失低于2%,优于先前的最先进方法。
Deep convolutional neural network (DCNN) has achieved remarkable performance on object detection and speech recognition in recent years. However, the excellent performance of a DCNN incurs high computational complexity and large memory requirement. In this paper, an equal distance nonuniform quantization (ENQ) scheme and a K-means clustering nonuniform quantization (KNQ) scheme are proposed to reduce the required memory storage when low complexity hardware or software implementations are considered. For the VGG-16 and the AlexNet, the proposed nonuniform quantization schemes reduce the number of required memory storage by approximately 50\% while achieving almost the same or even better classification accuracy compared to the state-of-the-art quantization method. Compared to the ENQ scheme, the proposed KNQ scheme provides a better tradeoff when higher accuracy is required.
研究动机与目标
- 为低复杂度硬件或软件实现中的深度卷积神经网络(DCNN)激活减少内存存储需求。
- 解决如VGG-16和AlexNet等深层网络中全精度激活导致的高内存占用问题。
- 通过实现与激活分布更匹配的层内非均匀量化,改进现有量化方案。
- 通过每层自适应量化,在精度与内存使用之间实现硬件友好的权衡。
- 与最先进方法相比,实现显著的内存节省,同时保持或提升分类精度。
提出的方法
- 提出等距层内非均匀量化(ENQ),基于每层激活分布统计信息,采用等间距的量化级别。
- 引入基于K均值聚类的层内非均匀量化(KNQ),通过在激活值上应用K均值聚类确定聚类中心,以最小化量化误差。
- 根据激活分布方差实施层内位宽分配,以最小化每精度水平下的内存使用量。
- 采用预处理技术(如归一化或缩放)以提升聚类或等间距量化前的量化精度。
- 使用TSMC 90nm CMOS工艺实现,评估硬件开销,表明量化单元具有低面积和关键路径延迟。
- 采用归一化位数(NNB)和绝对内存大小(NB)对比指标,与先前工作(包括跨层非均匀量化[13])进行基准对比。
实验结果
研究问题
- RQ1与跨层方法相比,层内非均匀量化是否能更有效地减少DCNN激活的内存存储?
- RQ2基于K均值聚类的量化是否在激活量化方面相比等距量化提供更高的精度和内存效率?
- RQ3在VGG-16和AlexNet中,内存使用量可减少到何种程度,同时保持高分类精度?
- RQ4预处理对非均匀量化方案的性能(精度与位宽分配)有何影响?
- RQ5与ENQ及先前最先进量化方法相比,KNQ的硬件复杂度权衡如何?
主要发现
- KNQ方案相比[13]中的最先进方法,内存存储减少约50%,VGG-16内存降至8.4 MB(对比16.8 MB),AlexNet降至0.48 MB(对比1.12 MB)。
- 在VGG-16上,KNQ使用每激活仅5位即实现86.58%的top-5精度,较[13]方法精度提升0.36%。
- ENQ方案相比[13]减少50%内存使用,VGG-16内存为9.5 MB,AlexNet为0.48 MB,与半精度浮点模型相比精度损失仅为1.9%。
- 经预处理后,KNQ在仅使用5位时使VGG-16的top-5精度提升至86.58%,在仅使用3位时使AlexNet精度提升至78.23%。
- KNQ单元的硬件实现面积为7.5 mm²,关键路径延迟为0.65 ns,表明其在嵌入式部署中具有较低开销。
- ENQ与KNQ在VGG-16和AlexNet上与全精度浮点模型相比,精度下降均低于2%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。