Skip to main content
QUICK REVIEW

[论文解读] RowClone: Accelerating Data Movement and Initialization Using DRAM

Vivek Seshadri, Yoongu Kim|arXiv (Cornell University)|May 7, 2018
Parallel Computing and Optimization Techniques参考文献 68被引用 12
一句话总结

RowClone 提出了一种低成本、基于 DRAM 内部架构的机制,通过利用 DRAM 的内部结构来加速批量数据复制和初始化。通过使用快速并行模式(同一子阵列内连续的 ACTIVATE 命令)和流水线串行模式(通过共享总线在不同 bank 间传输数据),RowClone 相较于传统的 CPU 驱动传输,将延迟和能耗降低了两个数量级。

ABSTRACT

In existing systems, to perform any bulk data movement operation (copy or initialization), the data has to first be read into the on-chip processor, all the way into the L1 cache, and the result of the operation must be written back to main memory. This is despite the fact that these operations do not involve any actual computation. RowClone exploits the organization and operation of commodity DRAM to perform these operations completely inside DRAM using two mechanisms. The first mechanism, Fast Parallel Mode, copies data between two rows inside the same DRAM subarray by issuing back-to-back activate commands to the source and the destination row. The second mechanism, Pipelined Serial Mode, transfers cache lines between two banks using the shared internal bus. RowClone significantly reduces the raw latency and energy consumption of bulk data copy and initialization. This reduction directly translates to improvement in performance and energy efficiency of systems running copy or initialization-intensive workloads

研究动机与目标

  • 解决现代系统中因内存带宽限制而日益加剧的性能和能耗瓶颈问题。
  • 通过将批量数据移动操作(特别是复制和初始化)从 CPU 转移至 DRAM,降低其高延迟和高能耗成本。
  • 在不修改 DRAM 单元阵列的前提下,实现显著的性能和能效提升。
  • 证明通用 DRAM 的内部组织结构可被用于高效内存内数据移动。
  • 激发未来针对新兴内存技术的内存内计算和数据移动优化研究。

提出的方法

  • 利用快速并行模式(FPM)通过同一 DRAM 子阵列内连续的两个 ACTIVATE 命令,实现两行之间的数据复制。
  • 采用流水线串行模式(PSM)通过共享内部 DRAM 总线,实现不同 bank 间行之间的数据传输。
  • 利用现有的 DRAM 外围逻辑,仅对支持连续 ACTIVATE 的 FPM 和流水线访问的 PSM 进行最小修改。
  • 在 DRAM 内部完全执行批量数据复制和初始化,无需 CPU 和内存总线参与。
  • 利用行缓冲和子阵列架构,实现数据移动操作的高内部带宽。
  • 依赖通用 DRAM 的现有命令接口和时序约束,实现低开销的内存内操作。

实验结果

研究问题

  • RQ1是否可以通过完全在 DRAM 内部执行而非依赖 CPU 和内存总线来加速批量数据复制和初始化操作?
  • RQ2哪些机制可以利用 DRAM 的内部结构,在不修改 DRAM 单元阵列的前提下,实现高带宽、低延迟的数据移动?
  • RQ3通过仅进行少量硬件改动,将批量数据移动卸载至 DRAM,能实现多大程度的性能和能耗提升?
  • RQ4RowClone 的原理能否扩展至其他内存技术,如 PCM、STT-MRAM 或 NAND 闪存?
  • RQ5通过内存内执行,还能加速哪些更广泛的内存密集型操作类别?

主要发现

  • 与传统 CPU 驱动方法相比,RowClone 将批量数据复制和初始化的延迟降低了两个数量级。
  • 由于消除了高速总线传输,批量数据移动的能耗降低了高达 90%。
  • 快速并行模式通过仅使用连续的 ACTIVATE 命令,实现了同一子阵列内行间数据复制的极低开销。
  • 流水线串行模式通过利用共享内部 DRAM 总线,实现了高效的跨 bank 数据传输,降低了竞争和延迟。
  • RowClone 的机制与通用 DRAM 兼容,仅需对外围控制逻辑进行微小修改。
  • 该技术已激发后续关于内存内按位操作、布尔代数和算术运算的研究,证明了其更广泛的应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。