[论文解读] SparseNN: An Energy-Efficient Neural Network Accelerator Exploiting Input and Output Sparsity
SparseNN 提出了一种新颖的节能型深度神经网络(DNN)加速器,通过端到端训练的稀疏性预测器,联合利用输入和输出激活的稀疏性。通过在计算开销低于5%的情况下预测输出稀疏性,SparseNN 相较于仅利用输入稀疏性的最先进加速器,实现了10%–70%更高的吞吐量和50%更低的功耗。
Contemporary Deep Neural Network (DNN) contains millions of synaptic connections with tens to hundreds of layers. The large computation and memory requirements pose a challenge to the hardware design. In this work, we leverage the intrinsic activation sparsity of DNN to substantially reduce the execution cycles and the energy consumption. An end-to-end training algorithm is proposed to develop a lightweight run-time predictor for the output activation sparsity on the fly. From our experimental results, the computation overhead of the prediction phase can be reduced to less than 5% of the original feedforward phase with negligible accuracy loss. Furthermore, an energy-efficient hardware architecture, SparseNN, is proposed to exploit both the input and output sparsity. SparseNN is a scalable architecture with distributed memories and processing elements connected through a dedicated on-chip network. Compared with the state-of-the-art accelerators which only exploit the input sparsity, SparseNN can achieve a 10%-70% improvement in throughput and a power reduction of around 50%.
研究动机与目标
- 解决嵌入式系统中深度神经网络(DNNs)面临的高能耗和高内存需求问题。
- 克服先前加速器仅利用输入稀疏性而忽略输出稀疏性的局限性。
- 设计一种运行时输出激活稀疏性预测器,计算开销极低。
- 设计一种可扩展的、基于网络芯片(NoC)的硬件架构(SparseNN),以高效利用输入和输出稀疏性。
- 在现有SIMD和EIE风格加速器的基础上,显著提升吞吐量和能效。
提出的方法
- 提出一种端到端训练算法,通过反向传播学习用于输出稀疏性预测的U和V矩阵。
- 采用类似截断SVD的分解方法,在实际计算前预测输出稀疏性,对前向传播阶段的计算开销低于5%。
- 设计一种可扩展的片上网络(NoC)架构,配备分布式的处理单元(PE)和存储器,以实现高并行性。
- 集成稀疏性感知的内存访问和计算调度机制,跳过输入和输出特征图中的零激活值。
- 使用65nm工艺在ASIC中实现SparseNN,片上SRAM用于存储权重(W),以及用于稀疏性预测的辅助矩阵(U, V)。
- 使用专用片上网络连接PE和存储器,最大限度减少通信瓶颈,并支持可扩展性。
实验结果
研究问题
- RQ1能否设计一种计算开销极低的端到端训练输出激活稀疏性预测器?
- RQ2联合利用输入和输出稀疏性对DNN推理的吞吐量和能效有何影响?
- RQ3可扩展的基于NoC的硬件架构能否高效支持输入和输出稀疏性的利用?
- RQ4与EIE和LRADNN等最先进加速器相比,SparseNN的性能和能效增益如何?
- RQ5稀疏性预测的准确性和可扩展性如何随不同网络秩和DNN模型变化?
主要发现
- 稀疏性预测阶段对原始前向传播的计算开销增加不足5%,且精度损失可忽略不计。
- 与仅利用输入稀疏性的加速器相比,SparseNN 实现了10%–70%更高的吞吐量,提升程度因层和数据集而异。
- 当同时利用输入和输出稀疏性时,功耗降低约50%,主要得益于减少的内存访问次数和低功耗的稀疏性预测机制。
- 面积分布显示,94.8%的总面积由存储器(主要是用于W、U和V矩阵的片上SRAM)占用,而PE占存储器总面积的99.2%。
- 在缩放至65nm工艺时,与28nm SIMD架构(DNN-Engine)相比,SparseNN 的能效提升达4倍,主要得益于高效的稀疏性利用。
- 在更深的层中,执行周期的减少最为显著(最高降低70%),这得益于前序层预测的输出稀疏性提升了后续层的输入稀疏性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。