[论文解读] A Low-Power Accelerator for Deep Neural Networks with Enlarged Near-Zero Sparsity
该论文提出了一种低功耗DNN加速器,通过近零值近似单元(NZAU)利用近零稀疏性——超越传统零值稀疏性——跳过小权重激活的乘法运算。通过动态识别并近似低于可配置阈值的近零值,该设计在LeNet-5中将乘法运算减少1.92倍,在AlexNet中减少1.51倍,且精度损失可忽略不计,功耗相比移动GPU降低717倍,同时在UMC 65nm工艺下以500 MHz运行时速度提升4倍。
It remains a challenge to run Deep Learning in devices with stringent power budget in the Internet-of-Things. This paper presents a low-power accelerator for processing Deep Neural Networks in the embedded devices. The power reduction is realized by avoiding multiplications of near-zero valued data. The near-zero approximation and a dedicated Near-Zero Approximation Unit (NZAU) are proposed to predict and skip the near-zero multiplications under certain thresholds. Compared with skipping zero-valued computations, our design achieves 1.92X and 1.51X further reduction of the total multiplications in LeNet-5 and Alexnet respectively, with negligible lose of accuracy. In the proposed accelerator, 256 multipliers are grouped into 16 independent Processing Lanes (PL) to support up to 16 neuron activations simultaneously. With the help of data pre-processing and buffering in each PL, multipliers can be clock-gated in most of the time even the data is excessively streaming in. Designed and simulated in UMC 65 nm process, the accelerator operating at 500 MHz is $>$ 4X faster than the mobile GPU Tegra K1 in processing the fully-connected layer FC8 of Alexnet, while consuming 717X less energy.
研究动机与目标
- 为解决物联网设备中DNN推理的高功耗问题。
- 将现有零值跳过技术扩展至包含近零值乘法运算,这些运算通常计算浪费但数值上可忽略。
- 设计一种硬件加速器,通过专用NZAU高效检测并跳过近零乘法运算,提升能效比而不损失模型精度。
- 通过结合数据缓冲、时钟门控和处理通道并行,在256乘法器架构中实现高吞吐量和低功耗。
提出的方法
- 近零值近似单元(NZAU)预测并跳过权重与激活乘积低于可配置阈值的乘法运算,将此类值视为可忽略。
- 通过基于阈值的近似方法对权重与激活乘积进行处理,实现超越零值元素的稀疏性。
- 加速器采用16条独立处理通道(PLs),每条通道包含16个乘法器,可并行处理16个神经元激活。
- 每条处理通道中预处理和缓冲数据,使乘法器在大多数周期内被时钟门控,即使在高数据流下也能降低动态功耗。
- 通过操作数缓冲和寄存器隔离,将数据存储与计算解耦,最大限度减少空闲功耗。
- 近零近似阈值可调节,支持在精度与能效之间进行权衡。
实验结果
研究问题
- RQ1能否有效利用近零稀疏性,在零值稀疏性之外进一步减少DNN计算?
- RQ2与仅跳过零值相比,通过近似处理近零值而非仅跳过,能额外降低多少乘法运算和功耗?
- RQ3硬件加速器能否在不造成显著精度下降的前提下,高效检测并跳过近零乘法运算?
- RQ4与通用移动GPU相比,基于专用NZAU的加速器在DNN推理中能带来多大的性能和能效提升?
主要发现
- 在LeNet-5中,所提出的近零近似使稀疏性从29.4%提升至63.35%,错误率仅增加0.58%,总乘法运算量减少1.92倍。
- 在AlexNet中,近零近似使稀疏性从45.9%提升至64.1%,乘法运算量减少1.51倍,精度损失可忽略不计。
- 在处理AlexNet的FC8层时,该加速器吞吐量比移动GPU Tegra K1高4倍,工作频率为500 MHz,采用UMC 65nm工艺。
- 与Tegra K1 GPU相比,功耗降低717倍,应用近零近似后最终功耗为31 mW。
- 得益于数据缓冲和NZAU实现的时钟门控,乘法器活动减少,相比仅跳过零值,额外实现18.4%的功耗降低。
- 通过有效的数据缓冲和16条独立处理通道中的流水线处理,加速器保持了高利用率并避免了停顿。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。