[论文解读] Accelerating Bulk Bit-Wise X(N)OR Operation in Processing-in-DRAM Platform
该论文提出DRIM,一种高吞吐量的Processing-in-DRAM(PIM)架构,通过利用模拟DRAM子阵列操作的新型双行激活(DRA)机制,加速批量按位X(N)OR操作。通过修改感测放大器并实现在同一bit-line上的操作数之间的内存内计算,DRIM实现了比CPU高71倍的吞吐量和比GPU高8.4倍的性能,相较于先前的PIM架构最高提升3.7倍,且数据复制能耗相比DDR4降低69倍。
With Von-Neumann computing architectures struggling to address computationally- and memory-intensive big data analytic task today, Processing-in-Memory (PIM) platforms are gaining growing interests. In this way, processing-in-DRAM architecture has achieved remarkable success by dramatically reducing data transfer energy and latency. However, the performance of such system unavoidably diminishes when dealing with more complex applications seeking bulk bit-wise X(N)OR- or addition operations, despite utilizing maximum internal DRAM bandwidth and in-memory parallelism. In this paper, we develop DRIM platform that harnesses DRAM as computational memory and transforms it into a fundamental processing unit. DRIM uses the analog operation of DRAM sub-arrays and elevates it to implement bit-wise X(N)OR operation between operands stored in the same bit-line, based on a new dual-row activation mechanism with a modest change to peripheral circuits such sense amplifiers. The simulation results show that DRIM achieves on average 71x and 8.4x higher throughput for performing bulk bit-wise X(N)OR-based operations compared with CPU and GPU, respectively. Besides, DRIM outperforms recent processing-in-DRAM platforms with up to 3.7x better performance.
研究动机与目标
- 解决现有PIM平台在加速基于XOR和加法的计算工作负载(如DNA比对和加密)时吞吐量有限的问题。
- 克服先前PIM设计依赖多周期操作和行初始化进行复杂逻辑操作时效率低下的问题。
- 通过利用模拟操作,在DRAM子阵列内直接实现高吞吐量、高能效的按位X(N)OR计算。
- 通过引入最小的电路修改,在保持与商品DRAM兼容性的同时,最小化面积和能耗开销。
- 展示DRIM在性能和能效方面相较于CPU、GPU以及最先进的PIM加速器(如Ambit和DRISA)的显著优势。
提出的方法
- 提出一种双行激活(DRA)机制,实现存储在相同DRAM子阵列中不同字线内的两个操作数之间的按位X(N)OR计算。
- 利用DRAM子阵列的模拟特性,通过双行激活期间受控的电荷共享来调节bit-line电压。
- 通过在每个感测放大器中增加22个晶体管,修改感测放大器以支持双行激活,实现选择性激活和电压比较。
- 引入双接触单元(DCC),并修改字线驱动器(从4:16改为4:12 MRD),以在极小面积成本下支持新激活方案。
- 使用控制单元(Ctrl)生成激活信号并管理指令执行,通过内存控制器预处理支持虚拟地址映射与页表转换。
- 优化内存布局和交织策略,以最大化空间局部性并减少跨内存模块的数据移动。
实验结果
研究问题
- RQ1PIM架构能否在批量按位X(N)OR操作上显著超越传统CPU和GPU平台的吞吐量?
- RQ2像双行激活(DRA)这样的新型内存内计算机制,能否克服基于多周期操作和行初始化的PIM设计在XOR逻辑操作中的局限性?
- RQ3在不牺牲可靠性或性能的前提下,将X(N)OR加速功能集成到商品DRAM中,其面积和能耗开销如何?
- RQ4DRIM在X(N)OR相关工作负载下,与现有PIM平台(如Ambit和DRISA)相比,在性能和能效方面表现如何?
- RQ53D堆叠DRAM在多大程度上能进一步提升基于DRIM的系统性能?
主要发现
- 对于批量按位X(N)OR操作,DRIM的平均吞吐量比Core-i7 CPU高71倍,比NVIDIA GTX 1080Ti GPU高8.4倍。
- 在X(N)OR相关工作负载中,DRIM相比现有PIM平台(如Ambit和DRISA-1T1C)的吞吐量最高提升3.7倍。
- 与Ambit相比,DRIM的能耗降低2.4倍;与DDR4接口上的数据复制相比,能耗降低69倍。
- 对于按位加法操作,DRIM相比Ambit能耗降低约2倍,相比DRISA-1T1C降低1.7倍,相比CPU降低27倍。
- 基于DRIM的3D堆叠DRAM可使HMC 2.0性能提升约13.5倍。
- DRIM的总面积开销估计为DRAM芯片面积的约9.3%,主要源于感测放大器中增加的晶体管以及修改后的字线驱动器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。