[论文解读] Adaptive Precision CNN Accelerator Using Radix-X Parallel Connected Memristor Crossbars
该论文提出一种基于并联连接忆阻器交叉阵列的基数-X卷积神经网络(CNN)加速器,通过自适应调整每个交叉点的忆阻器数量,实现多比特及负权重表示,同时减少面积开销。通过消除用于表示符号权重的重复列,该设计在仅使用单比特忆阻器和协同设计的权重映射算法的前提下,使交叉阵列面积减少46%,并在CIFAR-10数据集上达到90.5%的验证准确率——比二值化网络高出4.5%。
Neural processor development is reducing our reliance on remote server access to process deep learning operations in an increasingly edge-driven world. By employing in-memory processing, parallelization techniques, and algorithm-hardware co-design, memristor crossbar arrays are known to efficiently compute large scale matrix-vector multiplications. However, state-of-the-art implementations of negative weights require duplicative column wires, and high precision weights using single-bit memristors further distributes computations. These constraints dramatically increase chip area and resistive losses, which lead to increased power consumption and reduced accuracy. In this paper, we develop an adaptive precision method by varying the number of memristors at each crosspoint. We also present a weight mapping algorithm designed for implementation on our crossbar array. This novel algorithm-hardware solution is described as the radix-X Convolutional Neural Network Crossbar Array, and demonstrate how to efficiently represent negative weights using a single column line, rather than double the number of additional columns. Using both simulation and experimental results, we verify that our radix-5 CNN array achieves a validation accuracy of 90.5% on the CIFAR-10 dataset, a 4.5% improvement over binarized neural networks whilst simultaneously reducing crossbar area by 46% over conventional arrays by removing the need for duplicate columns to represent signed weights.
研究动机与目标
- 解决传统忆阻器交叉阵列为表示符号权重而使用重复列所导致的高面积与功耗开销问题。
- 在不增加芯片面积的前提下,实现在低精度忆阻器基CNN加速器中支持多比特及负权重表示。
- 通过协同设计硬件感知算法,减轻深度学习推理中的冯·诺依曼瓶颈。
- 通过每个交叉点忆阻器数量可变的自适应精度机制,利用单比特忆阻器提升边缘AI加速器的准确率与面积效率。
- 通过大规模仿真(CIFAR-10)与小规模实验验证(MNIST)证明其可行性。
提出的方法
- 所提出的架构在每个交叉点采用并联连接的忆阻器,每个单元中忆阻器数量决定有效权重值,从而实现基数-X表示。
- 提出一种新型权重映射算法,根据用户选择的精度将预训练的CNN权重编码为基数-X值,并为更高权重幅值分配多个忆阻器。
- 在基数-X框架内采用平衡数位系统编码负权重,从而无需额外的差分列对。
- 利用列级并行性实现高效的矩阵-向量乘法(MVM),读取电流线性映射为输出特征。
- 交叉阵列采用20µm金属线宽制造,通过小规模阵列实验验证了MNIST图像与边缘检测滤波器的性能。
- 系统针对推理优化,通过仅在初始编程后使用读取脉冲,最小化写操作并避免写入可变性问题。
实验结果
研究问题
- RQ1通过每个交叉点忆阻器数量可变的自适应精度,是否能在减少芯片面积的同时,实现比二值化网络更高的准确率?
- RQ2如何在不增加列数的前提下,高效表示单比特忆阻器交叉阵列中的负权重?
- RQ3与传统的差分列方法相比,基数-X架构在精度与面积效率方面提升程度如何?
- RQ4由于并联忆阻器数量增加导致等效电阻降低,对电流承载能力与功耗效率有何影响?
- RQ5所提出的算法-硬件协同设计是否能在仅使用单比特忆阻器的前提下,于CIFAR-10与MNIST等标准数据集上实现高推理准确率?
主要发现
- 基数-5 CNN加速器在CIFAR-10数据集上实现了90.5%的验证准确率,相比二值化神经网络提升4.5%。
- 与传统用于符号权重的差分列架构相比,所提设计使交叉阵列面积减少46%。
- 小规模交叉阵列实验成功实现了MNIST图像上3×3卷积核的2D卷积,输出图像近乎完美。
- MNIST边缘检测任务中,单列总电流测量值为4.0µA,表明该规模下的功耗在可管理范围内。
- 与传统差分对设计中使用四列相比,基数-5方案仅用两列即实现了比2位表示高20%的精度。
- 通过避免初始编程后的写操作,该设计保持了高可靠性,从而消除了写入可变性与耐久性退化问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。