[论文解读] DNN+NeuroSim V2.0: An End-to-End Benchmarking Framework for Compute-in-Memory Accelerators for On-chip Training
DNN+NeuroSim V2.0 是一个端到端的基准测试框架,将 PyTorch 与 NeuroSim 集成,用于建模片上训练用的存算一体(CIM)加速器,包含 SRAM 和 eNVM 器件中的非理想器件行为,如非线性、非对称性和器件间差异。该框架可准确评估 VGG-8 在 CIFAR-10 上的训练精度、能效、吞吐量和面积,揭示了实现可行片上训练的关键器件规格。
DNN+NeuroSim is an integrated framework to benchmark compute-in-memory (CIM) accelerators for deep neural networks, with hierarchical design options from device-level, to circuit-level and up to algorithm-level. A python wrapper is developed to interface NeuroSim with a popular machine learning platform: Pytorch, to support flexible network structures. The framework provides automatic algorithm-to-hardware mapping, and evaluates chip-level area, energy efficiency and throughput for training or inference, as well as training/inference accuracy with hardware constraints. Our prior work (DNN+NeuroSim V1.1) was developed to estimate the impact of reliability in synaptic devices, and analog-to-digital converter (ADC) quantization loss on the accuracy and hardware performance of inference engines. In this work, we further investigated the impact of the analog emerging non-volatile memory non-ideal device properties for on-chip training. By introducing the nonlinearity, asymmetry, device-to-device and cycle-to-cycle variation of weight update into the python wrapper, and peripheral circuits for error/weight gradient computation in NeuroSim core, we benchmarked CIM accelerators based on state-of-the-art SRAM and eNVM devices for VGG-8 on CIFAR-10 dataset, revealing the crucial specs of synaptic devices for on-chip training. The proposed DNN+NeuroSim V2.0 framework is available on GitHub.
研究动机与目标
- 实现对片上深度神经网络(DNN)训练用存算一体(CIM)加速器的准确、端到端基准测试。
- 解决在新兴的非易失性存储器(eNVM)和基于 SRAM 的 CIM 架构中,权重更新期间非理想器件行为(如非线性、非对称性和器件间差异)缺乏全面建模的问题。
- 通过与 PyTorch 集成的 Python 包装器,支持灵活的网络结构支持和自动的算法到硬件映射。
- 在硬件约束下评估芯片级性能指标,包括面积、能效、吞吐量和训练精度。
- 识别出基于先进 SRAM 和 eNVM 技术实现可行片上 DNN 训练的关键器件级规格。
提出的方法
- 开发了 Python 包装器,将 NeuroSim 与 PyTorch 接口连接,实现动态且灵活的 DNN 模型集成。
- 扩展了 NeuroSim 核心功能,以建模非理想突触器件行为,包括权重更新操作期间的非线性、非对称性和周期间差异。
- 集成用于误差和梯度计算的外围电路,以模拟 CIM 架构中的训练动态。
- 实现自动的算法到硬件映射,将 DNN 层映射到 CIM 硬件配置。
- 集成先前版本中的 ADC 量化损失建模和可靠性效应,以支持全面的训练精度估计。
- 在 CIFAR-10 数据集上对 VGG-8 进行端到端仿真,以评估性能与精度之间的权衡。
实验结果
研究问题
- RQ1非理想器件特性(如非线性、非对称性和差异性)如何影响 CIM 加速器中片上 DNN 训练的精度和收敛性?
- RQ2SRAM 和 eNVM 的关键器件级规格是什么,能够实现准确且高效的片上训练?
- RQ3集成用于梯度和误差计算的外围电路如何影响 CIM 加速器的整体训练性能和能效?
- RQ4ADC 量化和器件可变性在多大程度上会降低 CIM 系统中的训练精度?
- RQ5基于 SRAM 和 eNVM 的不同 CIM 架构在片上训练中的能效、吞吐量和精度方面有何差异?
主要发现
- 非理想器件行为(如非线性和非对称性)显著降低训练精度,尤其在基于 eNVM 的 CIM 加速器中更为明显。
- 权重更新操作中的器件间差异和周期间差异引入了显著的性能波动,若无校正机制,将限制片上训练的可行性。
- 该框架揭示,eNVM 器件需对非线性和非对称性实施更严格的控制,才能在 CIFAR-10 上的 VGG-8 上实现可接受的精度。
- 与 eNVM 相比,基于 SRAM 的 CIM 加速器对器件变化更具鲁棒性,尽管其面积和能效开销更高。
- ADC 量化损失仍是精度下降的主要因素,尤其在低精度训练环境中。
- 集成用于误差和梯度计算的外围电路,可准确模拟 CIM 中的反向传播,验证了该框架对真实训练动态建模的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。