Skip to main content
QUICK REVIEW

[论文解读] An Analog Neural Network Computing Engine using CMOS-Compatible Charge-Trap-Transistor (CTT)

Yuan Du, Li Du|arXiv (Cornell University)|Sep 19, 2017
Advanced Memory and Neural Computing参考文献 30被引用 3
一句话总结

该论文提出了一种基于电荷俘获晶体管(CTTs)作为模拟乘法器的CMOS兼容模拟神经网络计算引擎,实现500 MHz时钟频率下76.8 TOPS的性能,功耗仅为14.8 mW。该设计采用可扩展的CTT乘法器阵列与顺序模拟结构(SAF),显著降低面积与功耗,在8位定点精度下于MNIST数字分类任务中展现出业界领先性能。

ABSTRACT

An analog neural network computing engine based on CMOS-compatible charge-trap transistor (CTT) is proposed in this paper. CTT devices are used as analog multipliers. Compared to digital multipliers, CTT-based analog multiplier shows significant area and power reduction. The proposed computing engine is composed of a scalable CTT multiplier array and energy efficient analog-digital interfaces. Through implementing the sequential analog fabric (SAF), the engine mixed-signal interfaces are simplified and hardware overhead remains constant regardless of the size of the array. A proof-of-concept 784 by 784 CTT computing engine is implemented using TSMC 28nm CMOS technology and occupied 0.68mm2. The simulated performance achieves 76.8 TOPS (8-bit) with 500 MHz clock frequency and consumes 14.8 mW. As an example, we utilize this computing engine to address a classic pattern recognition problem -- classifying handwritten digits on MNIST database and obtained a performance comparable to state-of-the-art fully connected neural networks using 8-bit fixed-point resolution.

研究动机与目标

  • 开发一种适用于边缘AI应用的低功耗、高面积效率神经网络加速器。
  • 利用CMOS兼容的电荷俘获晶体管(CTTs)作为模拟乘法器,相比数字乘法器显著降低面积与功耗。
  • 通过顺序模拟结构(SAF)简化混合信号接口,确保接口电路的硬件开销不随阵列规模增加而上升。
  • 在28nm CMOS工艺下实现真实硅片验证,展示高性能与高能效。
  • 在标准基准测试(如MNIST)中,使用8位定点精度实现具有竞争力的推理准确率。

提出的方法

  • 计算引擎采用可扩展的CTT器件阵列,配置为模拟乘法器,用于在神经网络中执行点积运算。
  • 电荷俘获晶体管通过存储与调制电荷来表示突触权重,实现高能效的模拟计算。
  • 采用顺序模拟结构(SAF)以优化数据流并降低混合信号接口的复杂度。
  • SAF设计确保在阵列规模扩展时,接口电路的硬件开销保持恒定。
  • 系统采用台积电28nm CMOS工艺制造,784×784 CTT阵列占用0.68 mm²面积。
  • 模拟-数字与数字-模拟转换器经过优化,实现低功耗与高速性能,支持500 MHz运行。

实验结果

研究问题

  • RQ1与数字乘法器相比,基于CTT的模拟乘法器在神经网络加速器中能否实现显著的面积与功耗节省?
  • RQ2在大规模模拟神经网络阵列中,如何最小化混合信号接口的复杂度?
  • RQ3在阵列规模扩展时,顺序模拟结构(SAF)在多大程度上能保持恒定的硬件开销?
  • RQ4在采用28nm CMOS与CTT技术的真实硅片实现中,可达到怎样的性能与能效?
  • RQ5所提出的引擎能否在标准基准测试(如MNIST)中,使用8位定点精度实现具有竞争力的推理准确率?

主要发现

  • 784×784 CTT计算引擎在台积电28nm CMOS工艺下仅占用0.68 mm²面积。
  • 该引擎在500 MHz时钟频率下实现76.8 TOPS性能,功耗为14.8 mW。
  • 系统在MNIST数据集上使用8位定点精度时,分类准确率与当前最先进的全连接神经网络相当。
  • 采用顺序模拟结构(SAF)可确保混合信号接口开销不随阵列规模增加而上升,实现可扩展设计。
  • 仿真结果验证了基于CTT的模拟乘法器相比传统数字乘法器可实现显著的面积与功耗降低。
  • 该设计完全兼容CMOS工艺,可与标准数字逻辑及制造流程无缝集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。