[论文解读] High Area/Energy Efficiency RRAM CNN Accelerator with Kernel-Reordering Weight Mapping Scheme Based on Pattern Pruning
本文提出了一种基于新型基于模式剪枝的核重排权重映射方案的高面积效率和高能效RRAM-CNN加速器。通过利用模式剪枝带来的结构化稀疏性并结合操作单元(OU)机制,该设计在仅造成最小精度损失的前提下,相较于基线方法,实现了高达5.20倍的交叉条面积效率、2.15倍的能效提升以及1.35倍的性能加速。
Resistive Random Access Memory (RRAM) is an emerging device for processing-in-memory (PIM) architecture to accelerate convolutional neural network (CNN). However, due to the highly coupled crossbar structure in the RRAM array, it is difficult to exploit the sparsity of the network in RRAM-based CNN accelerator. To optimize the weight mapping of sparse network in the RRAM array and achieve high area and energy efficiency, we propose a novel weight mapping scheme and corresponding RRAM-based CNN accelerator architecture based on pattern pruning and Operation Unit(OU) mechanism. Experimental results show that our work can achieve 4.16x-5.20x crossbar area efficiency, 1.98x-2.15x energy efficiency, and 1.15x-1.35x performance speedup in comparison with the traditional weight mapping method.
研究动机与目标
- 为解决RRAM-CNN加速器在处理稀疏、非规则结构权重时面积效率和能效低下的挑战。
- 在不牺牲精度的前提下,有效利用RRAM交叉条阵列中的网络稀疏性。
- 设计一种硬件感知的权重映射方案,支持RRAM-PIM架构中的结构化稀疏性与高效计算。
- 通过结合模式剪枝与基于OU的计算机制,实现高性能、高面积效率和高能效。
提出的方法
- 提出一种模式剪枝算法,每层最多生成12种结构化、硬件友好的稀疏模式,实现RRAM交叉条中的高效映射。
- 设计一种基于核重排的权重映射方案,根据输出通道索引重新组织每个输入通道内的滤波器,以聚集相似模式并减少交叉条利用率。
- 采用操作单元(OU)机制,实现对字线和位线的细粒度激活,仅对非零模式执行选择性计算。
- 在输入预处理单元中集成全零模式检测模块,跳过不必要的ADC/DAC转换,降低动态能耗。
- 通过存储核输出通道位置和模式形状的索引,实现正确数据路由,而无需在RRAM中存储零权重模式。
- 设计完整的RRAM-CNN加速器架构,支持所提出的映射方案,并同时利用权重与特征图的稀疏性。
实验结果
研究问题
- RQ1如何在RRAM交叉条阵列中有效利用模式剪枝带来的结构化稀疏性,以提升面积和能效?
- RQ2核重排与基于OU的计算对稀疏CNN推理中交叉条利用率和能耗有何影响?
- RQ3模式剪枝能否在保持与RRAM-PIM架构兼容的同时,实现高稀疏性且精度损失极小?
- RQ4与朴素权重映射相比,所提出的映射方案在面积、能效和性能效率方面表现如何?
主要发现
- 所提出的模式剪枝映射方案相较于基线方法,实现4.16至5.20倍的交叉条面积效率提升,节省76.0%至80.8%的RRAM交叉条面积。
- 在CIFAR-10、CIFAR-100和ImageNet数据集上,能效提升1.98至2.15倍,其中ADC能耗为主要瓶颈。
- 实现1.15至1.35倍的性能加速,主要归因于全零模式计算的消除和内存访问的减少。
- 核重排的索引开销仅占总模型大小的12.2%(729.5KB–1013.5KB),与压缩后模型大小相比可接受。
- 该方法实现了接近理论最优的面积效率,结果接近理论最大值(CIFAR-10为86.03%),表明稀疏性被有效利用。
- 在ImageNet上的性能相对较低,原因在于模式剪枝结果不够理想,稀疏度较低且模式数量较多,导致映射效率下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。