Skip to main content
QUICK REVIEW

[论文解读] Direct CMOS Implementation of Neuromorphic Temporal Neural Networks for Sensory Processing

Harideep Nair, John Paul Shen|arXiv (Cornell University)|Aug 27, 2020
Advanced Memory and Neural Computing参考文献 22被引用 7
一句话总结

本论文提出了一种基于可扩展微架构单元——神经元、多神经元列及多层TNN的直接CMOS硬件实现,用于时间神经网络(TNNs),实现了类脑、能效比高的传感处理。该原型在7 nm CMOS工艺下,仅用1.54 mm²面积和7.26 mW功耗,即可实现28×28图像107M FPS的处理速度,证明了其在超低功耗边缘AI系统中的可行性。

ABSTRACT

Temporal Neural Networks (TNNs) use time as a resource to represent and process information, mimicking the behavior of the mammalian neocortex. This work focuses on implementing TNNs using off-the-shelf digital CMOS technology. A microarchitecture framework is introduced with a hierarchy of building blocks including: multi-neuron columns, multi-column layers, and multi-layer TNNs. We present the direct CMOS gate-level implementation of the multi-neuron column model as the key building block for TNNs. Post-synthesis results are obtained using Synopsys tools and the 45 nm CMOS standard cell library. The TNN microarchitecture framework is embodied in a set of characteristic equations for assessing the total gate count, die area, compute time, and power consumption for any TNN design. We develop a multi-layer TNN prototype of 32M gates. In 7 nm CMOS process, it consumes only 1.54 mm^2 die area and 7.26 mW power and can process 28x28 images at 107M FPS (9.34 ns per image). We evaluate the prototype's performance and complexity relative to a recent state-of-the-art TNN model.

研究动机与目标

  • 探索使用标准数字CMOS技术实现时间神经网络(TNNs)的实际可行性。
  • 基于分层构建模块(神经元、多神经元列、多层TNN)开发可扩展的微架构框架。
  • 通过硬件优化的STDP和R-STDP学习规则,实现在CMOS中生物合理、无监督、在线学习。
  • 证明TNN无需矩阵乘法或MAC单元,即可实现高速、低功耗传感处理。
  • 提供用于指导未来TNN硬件探索的面积、延迟、功耗和门控数量的设计空间表征方程。

提出的方法

  • 设计具有斜坡无漏电(RNL)响应及STDP/R-STDP学习规则的可扩展神经元的门级Verilog模型。
  • 实现具有赢家通吃(WTA)侧向抑制的多神经元列,以支持竞争性动力学。
  • 推导特征方程(公式3和4),基于突触数量(p)和神经元数量(q)建模总门数、芯片面积、计算时间及功耗。
  • 使用Synopsys工具和45 nm CMOS标准单元库进行逻辑综合与综合后评估。
  • 构建一个两层TNN原型(32M门),包含一个STDP(无监督)层和一个R-STDP(有监督)层,用于MNIST图像处理。
  • 利用工艺缩放参数将原型扩展至7 nm CMOS,以预测性能与能效指标。

实验结果

研究问题

  • RQ1时间神经网络能否在不依赖专用或非标准硬件的前提下,直接在标准数字CMOS中实现?
  • RQ2能否设计出基于神经元、列和层的分层微架构,以支持可扩展、高能效的TNN,并实现生物合理的学习?
  • RQ3TNN的面积、延迟、功耗和门控数量如何随神经元和突触数量变化而变化?
  • RQ4基于CMOS的TNN原型能否实现与最先进AI加速器相当的实时、低功耗传感处理?
  • RQ5TNN中缺乏矩阵乘法和MAC单元在多大程度上促成了其能效优势与硬件可扩展性?

主要发现

  • 两层TNN原型(32M门)在7 nm CMOS下处理28×28图像达到107M FPS,计算周期时间为9.34 ns。
  • 该原型在7 nm CMOS下仅消耗7.26 mW功耗,芯片面积仅为1.54 mm²,不足典型智能手机SoC芯片面积的2%。
  • 神经元复杂度主要由突触权重(50%)主导,其次为STDP(40%)和神经元胞体(10%)。
  • 列的复杂度几乎与神经元数量(q)和突触数量(p)的乘积呈线性关系,而关键路径延迟随p呈对数增长。
  • 面积和功耗与总突触数(p×q)呈线性关系,而列中神经元数量q对延迟影响极小。
  • 该设计展示了快速的训练收敛性和MNIST上的良好准确率,验证了TNN中在线、增量学习的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。