Skip to main content
QUICK REVIEW

[论文解读] The Processing Using Memory Paradigm:In-DRAM Bulk Copy, Initialization, Bitwise AND and OR

Vivek Seshadri, Onur Mutlu|arXiv (Cornell University)|Oct 30, 2016
Parallel Computing and Optimization Techniques参考文献 74被引用 17
一句话总结

本文提出两种基于现有DRAM结构(如感测放大器和位线)的片上DRAM技术——RowClone用于批量复制和初始化,In-DRAM AND/OR(IDAO)用于按位运算。两种方法均消除了片外数据移动,在内存密集型操作中将性能和能效提升一个数量级以上。

ABSTRACT

In existing systems, the off-chip memory interface allows the memory controller to perform only read or write operations. Therefore, to perform any operation, the processor must first read the source data and then write the result back to memory after performing the operation. This approach consumes high latency, bandwidth, and energy for operations that work on a large amount of data. Several works have proposed techniques to process data near memory by adding a small amount of compute logic closer to the main memory chips. In this article, we describe two techniques proposed by recent works that take this approach of processing in memory further by exploiting the underlying operation of the main memory technology to perform more complex tasks. First, we describe RowClone, a mechanism that exploits DRAM technology to perform bulk copy and initialization operations completely inside main memory. We then describe a complementary work that uses DRAM to perform bulk bitwise AND and OR operations inside main memory. These two techniques significantly improve the performance and energy efficiency of the respective operations.

研究动机与目标

  • 通过在DRAM内部直接执行操作,减少内存密集型工作负载中的数据移动延迟和能耗。
  • 探索利用现有DRAM外围结构而非新增逻辑单元,以低成本方式扩展内存内处理能力的方法。
  • 证明通过最小硬件修改,可在DRAM内部高效执行批量复制和按位与/或等复杂操作。
  • 评估这些片上DRAM机制在真实应用场景(如范围查询和位图索引)中的性能与能耗优势。

提出的方法

  • RowClone利用DRAM内部总线和感测放大器,在无需片外数据传输的情况下执行批量数据复制与初始化,利用PSM(伪静态存储)操作实现。
  • RowClone通过两次PSM操作在同一个bank内的子阵列之间实现数据移动,相比传统内存访问方式,显著降低能耗与延迟。
  • IDAO利用DRAM感测放大器的模拟感知能力,同时检测多个位线电压,并在并行处理中执行大规模位向量的按位与/或运算。
  • IDAO同时激活三行,并利用感测电压的叠加效应,在内存中直接计算逻辑运算,避免将数据移至处理器。
  • 这些机制仅对现有DRAM架构进行极小改动,完全依赖现有外围结构(如位线和感测放大器)。
  • 评估采用保守与激进配置,分别使用1个或4个bank,以在不同延迟与带宽约束下分析性能权衡。

实验结果

研究问题

  • RQ1是否可以完全在DRAM内部执行批量复制与初始化操作,而无需片外数据移动?
  • RQ2是否可以利用现有硬件结构在DRAM内部高效计算大规模位向量的按位与/或运算?
  • RQ3与传统片外处理相比,DRAM内部执行这些操作在性能与能效方面可提升多少?
  • RQ4不同配置(如bank数量、激活策略)对片上DRAM操作性能有何影响?

主要发现

  • RowClone消除了批量复制与初始化的片外数据移动,通过去除内存通道传输,显著降低延迟与能耗。
  • IDAO通过同时激活多行与模拟感知技术,在DRAM内部直接执行大规模按位与/或运算,性能提升超过10倍。
  • 在4个bank的激进IDAO配置下,与基线系统相比,范围查询性能平均提升30%。
  • 即使三行激活带来2倍延迟惩罚,1个bank的保守IDAO机制仍实现18%的性能提升。
  • RowClone与IDAO均显著减少片外内存带宽使用,使其在位图索引和系统级内存管理等数据密集型应用中极具有效性。
  • 这些技术成本低廉且可扩展,因其仅需对现有DRAM架构进行极小改动,并充分利用已存在的外围组件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。