[论文解读] A Long Short-Term Memory for AI Applications in Spike-based Neuromorphic Hardware
该论文提出了一种基于AHP神经元和脉冲关系网络(Spiking RelNet)的脉冲神经网络(SNN)架构,旨在实现神经形态硬件(如英特尔Loihi)上的高效人工智能推理。通过利用时间编码、优化的网络布局和基于脉冲的计算,该方法在能耗效率方面达到最先进水平——相比基于GPU的LSTM模型,能效提升高达21,025倍。该方法在sMNIST和bAbI问答任务上表现出高精度,同时实现极低的跨芯片通信和能耗。
Spike-based neuromorphic hardware holds the promise to provide more energy efficient implementations of Deep Neural Networks (DNNs) than standard hardware such as GPUs. But this requires to understand how DNNs can be emulated in an event-based sparse firing regime, since otherwise the energy-advantage gets lost. In particular, DNNs that solve sequence processing tasks typically employ Long Short-Term Memory (LSTM) units that are hard to emulate with few spikes. We show that a facet of many biological neurons, slow after-hyperpolarizing (AHP) currents after each spike, provides an efficient solution. AHP-currents can easily be implemented in neuromorphic hardware that supports multi-compartment neuron models, such as Intel's Loihi chip. Filter approximation theory explains why AHP-neurons can emulate the function of LSTM units. This yields a highly energy-efficient approach to time series classification. Furthermore it provides the basis for implementing with very sparse firing an important class of large DNNs that extract relations between words and sentences in a text in order to answer questions about the text.
研究动机与目标
- 开发适用于神经形态硬件(如英特尔Loihi)的节能脉冲神经网络,以支持人工智能工作负载。
- 解决多芯片SNN部署中脉冲拥塞严重和通信效率低下的挑战。
- 在序列和推理任务(sMNIST、bAbI)上,通过基于脉冲的计算实现高精度,同时能耗和延迟极低。
- 优化网络布局与连接方式,以减少跨芯片通信并提升硬件利用率。
- 与传统的CPU/GPU实现进行对比基准测试,以实现能效性能的直接比较。
提出的方法
- 采用具有自适应指数电流和不应期的AHP神经元,以提升SNN中的时间编码能力和记忆保持能力。
- 使用带有阻尼因子γ和缩放电压支持的代理梯度方法,实现对脉冲神经元的反向传播。
- 提出一种新型输入编码方案,针对MNIST图像,基于连续帧之间的像素变化生成脉冲。
- 设计一种Spiking RelNet,其中包含多个关系函数gθ的实例,各实例共享参数并经过优化的连接设计,用于处理句子对。
- 通过将中继层与gθ输入层共置,优化在Loihi芯片间的网络布局,以最小化跨芯片脉冲传输。
- 采用基于突触内存、输入轴突和输出轴突限制的约束性布局策略,以最小化硬件瓶颈和脉冲拥塞。
实验结果
研究问题
- RQ1基于AHP的SNN是否能在sMNIST基准测试中实现具有竞争力的准确率,同时在神经形态硬件上保持超低能耗?
- RQ2Spiking RelNet在bAbI问答任务上的能耗和延迟性能与传统深度学习模型相比如何?
- RQ3哪些网络布局策略能最小化多芯片神经形态系统中的脉冲拥塞和跨芯片通信?
- RQ4时间编码与脉冲动力学在多大程度上能保持序列建模和推理任务的性能?
- RQ5与CPU和GPU实现相比,Loihi上脉冲网络可实现的能耗延迟积(EDP)是多少?
主要发现
- AHP-SNN在sMNIST任务上实现了98.2%的准确率,能耗延迟积(EDP)为5.14 µJ,相比GPU基线提升了21,025.64倍。
- 在bAbI任务中,Spiking RelNet在10万次采样版本上达到94.7%的准确率,在1万次采样版本上达到91.7%,展示了在脉冲框架下的强大推理能力。
- Spiking RelNet在Loihi上的EDP为1423.70 µJ,相比CPU基线降低276.85倍,相比GPU基线降低21,025.64倍。
- 通过优化网络布局,将中继层与gθ输入层共置,减少了跨芯片通信,降低了所需中继网络数量,并有效缓解了脉冲拥塞。
- 能效基准测试显示,Loihi上AHP-SNN的动态功耗为24.33 mW,总功耗为25.83 mW,显著低于GPU和CPU的对应值。
- Spiking RelNet在Loihi上使用了2,308个核心,最大限制来自突触内存,布局设计在尊重硬件限制的前提下,最小化了芯片间通信。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。