[论文解读] A Power-Efficient Binary-Weight Spiking Neural Network Architecture for Real-Time Object Classification
该论文提出了一种基于二维流水线阵列的低功耗二值权重脉冲神经网络(BW-SNN)硬件架构,用于实现边缘设备上的实时片上目标分类。通过将整个网络存储在片上并利用流水线阵列设计最大化数据重用,五层BW-SNN在MNIST数据集上实现了98.73%的准确率,相比现有最先进设计,其每推理能耗降低23倍、面积缩小7倍,首次实现了支持先进CNN拓扑结构的超低功耗SNN硬件。
Neural network hardware is considered an essential part of future edge devices. In this paper, we propose a binary-weight spiking neural network (BW-SNN) hardware architecture for low-power real-time object classification on edge platforms. This design stores a full neural network on-chip, and hence requires no off-chip bandwidth. The proposed systolic array maximizes data reuse for a typical convolutional layer. A 5-layer convolutional BW-SNN hardware is implemented in 90nm CMOS. Compared with state-of-the-art designs, the area cost and energy per classification are reduced by 7$ imes$ and 23$ imes$, respectively, while also achieving a higher accuracy on the MNIST benchmark. This is also a pioneering SNN hardware architecture that supports advanced CNN architectures.
研究动机与目标
- 通过消除片外存储器带宽,实现在边缘设备上低功耗、实时的目标分类。
- 在SNN硬件中支持先进的CNN架构,这在现有设计中较为罕见。
- 通过二值权重网络和高效的数据重用,最小化面积与能耗。
- 在90nm CMOS工艺下实现完整的五层卷积BW-SNN,具备片上权重存储与实时推理能力。
- 与现有最先进SNN和DNN硬件加速器相比,展示出更优的能效与面积效率。
提出的方法
- 该架构采用包含处理元素阵列与缓冲链的二维流水线阵列,高效计算具有三维输入的二维卷积,最大化数据重用。
- 使用二值权重以简化计算并减少片上存储需求,实现网络的完全片上存储。
- 通过将K个三维卷积核重排并转置为(JC, I)矩阵,将它们映射到二维处理元素阵列上,实现高效的乘加运算。
- 由(I-1)W + J个缓冲器组成的缓冲链,具备C字存储容量,可实现卷积计算中正确的数据调度与延迟对齐。
- 神经元模块通过本地SRAM存储的参数实现积分-发放(IF)动力学,为下一层生成输出脉冲。
- 该设计采用90nm CMOS工艺实现,包含22.5K个等效门和12.75KB片上SRAM,工作频率为100MHz,功耗为52mW。
实验结果
研究问题
- RQ1二值权重SNN硬件架构是否能在无片外存储器访问的情况下,实现边缘设备上实时、低功耗的目标分类?
- RQ2如何有效映射流水线阵列,以支持具有高数据重用和最小面积开销的全卷积BW-SNN?
- RQ3在SNN硬件中,结合二值权重与流水线阵列设计,能在能耗、面积和准确率方面带来多大的性能提升?
- RQ4该架构是否能够支持如深度卷积网络等先进CNN拓扑结构,而不同于大多数先前的SNN硬件?
- RQ5在标准基准测试中,该BW-SNN与现有最先进DNN和SNN加速器相比,在能效与准确率方面表现如何?
主要发现
- 五层BW-SNN硬件在MNIST基准测试中实现98.73%的准确率,每推理仅消耗4.991 µJ能量,延迟为0.095 ms。
- 与现有最先进SNN和DNN加速器相比,该设计能耗降低23倍、面积缩小7倍,同时实现更高准确率。
- 芯片在100MHz频率下仅消耗52mW功耗,芯片面积为2.07mm²,展示了面向边缘推理的超低功耗运行能力。
- 后布局仿真结果确认,该设计支持0.5ms延迟的实时推理,足以满足实际应用场景需求。
- 流水线阵列实现全片上网络存储,消除了片外带宽需求,降低了系统级功耗。
- 该架构是首个支持如深度卷积网络等先进CNN拓扑结构的SNN硬件,为边缘设备中的实际部署提供了可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。