[论文解读] A 64-core mixed-signal in-memory compute chip based on phase-change memory for deep neural network inference
本论文提出了一款基于相变存储器(PCM)的64核混合信号存内计算芯片,可在片上完全执行深度神经网络推理,实现接近软件等效的精度。通过将64个基于PCM的AIMC核心与片上数字处理单元(用于激活函数)及核心间通信机制集成,该芯片在8位矩阵-向量乘法(MVM)运算中实现了63.1 TOPS的吞吐量和9.76 TOPS/W的能量效率。
The need to repeatedly shuttle around synaptic weight values from memory to processing units has been a key source of energy inefficiency associated with hardware implementation of artificial neural networks. Analog in-memory computing (AIMC) with spatially instantiated synaptic weights holds high promise to overcome this challenge, by performing matrix-vector multiplications (MVMs) directly within the network weights stored on a chip to execute an inference workload. However, to achieve end-to-end improvements in latency and energy consumption, AIMC must be combined with on-chip digital operations and communication to move towards configurations in which a full inference workload is realized entirely on-chip. Moreover, it is highly desirable to achieve high MVM and inference accuracy without application-wise re-tuning of the chip. Here, we present a multi-core AIMC chip designed and fabricated in 14-nm complementary metal-oxide-semiconductor (CMOS) technology with backend-integrated phase-change memory (PCM). The fully-integrated chip features 64 256x256 AIMC cores interconnected via an on-chip communication network. It also implements the digital activation functions and processing involved in ResNet convolutional neural networks and long short-term memory (LSTM) networks. We demonstrate near software-equivalent inference accuracy with ResNet and LSTM networks while implementing all the computations associated with the weight layers and the activation functions on-chip. The chip can achieve a maximal throughput of 63.1 TOPS at an energy efficiency of 9.76 TOPS/W for 8-bit input/output matrix-vector multiplications.
研究动机与目标
- 为解决因在存储器与处理单元之间反复移动权重而导致的DNN推理能效低下问题。
- 通过集成模拟存内计算(AIMC)与片上数字运算及通信机制,实现端到端的片上推理。
- 在不进行特定应用调优的前提下,利用非易失性PCM实现高推理精度与能效,用于密集且持久的权重存储。
- 通过支持多核、多层DNN工作负载的单芯片集成,将AIMC扩展至单核或小规模网络之外的实现。
提出的方法
- 采用后端集成相变存储器(PCM)的14纳米CMOS工艺设计与制造芯片,用于非易失性突触权重存储。
- 实现64个独立的256×256 AIMC核心,每个核心通过PCM电导状态直接在存储器中执行矩阵-向量乘法(MVM)。
- 采用定制的片上通信网络连接各核心,实现大层的分布式MVM执行。
- 集成片上数字单元(LDPU和GDPU),用于执行激活函数(如ReLU、tanh)和数据转换(PWM、ADC、DAC)。
- 应用基于公式(1)的电导映射方案,将网络权重映射至PCM单元电导,其中核心特定的$G_{\text{max}}$受ADC饱和与电流限制约束。
- 开发了一种功能硬件感知仿真模型,整合了输入量化(8位PWM)、ADC量化(12位)、LDPU/GDPU数据转换(8位)以及通过多项式拟合获得的各核心权重噪声实测数据。
实验结果
研究问题
- RQ1具备非易失性PCM的多核全集成AIMC芯片能否实现接近软件等效精度的端到端DNN推理?
- RQ2当所有MVM和数字运算均在片上完成时,基于PCM的AIMC芯片可实现的最大吞吐量与能效是多少?
- RQ3PCM与ADC组件中的片上权重噪声及非理想性如何影响多核环境下的推理精度?
- RQ4能否在不使用片外权重缓冲或逐层重编程的前提下,高效地将大型DNN(如ResNet-9、LSTM)映射至64个核心?
- RQ5核心特定的$G_{\text{max}}$缩放对多核PCM架构中MVM精度与能效有何影响?
主要发现
- 芯片在8位输入/输出矩阵-向量乘法中实现峰值吞吐量63.1 TOPS,能效为9.76 TOPS/W。
- 在ResNet-9和基于LSTM的图像字幕生成网络中,实现了接近软件等效的推理精度,且无需特定应用调优。
- 通过集成的LDPU和GDPU单元,芯片支持MVM与数字激活函数(如ReLU、tanh)的完整片上执行。
- 权重噪声被建模为与核心相关且依赖于权重的高斯分布,标准差通过多项式函数拟合实测各核心误差获得。
- 对于使用TDP PCM的ResNet-9,$G_{\text{max}}$值最高达160,提升了电导范围利用率,从而改善了MVM精度。
- 功耗测量显示,动态功耗主要由ADC和数字电源供应决定,总能量为所有监控电源的静态与动态功耗之和。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。