[论文解读] Moving Processing to Data: On the Influence of Processing in Memory on Data Management
本文研究了处理内存(PIM)作为一种范式,通过在存储器内部或附近直接执行计算操作,减少数据移动,利用3D堆叠DRAM和嵌入式处理单元。结果表明,PIM可显著提升性能、可扩展性和能效——尤其在图处理、神经网络和分析查询等数据密集型工作负载中,通过最小化CPU和内存带宽瓶颈实现。
Near-Data Processing refers to an architectural hardware and software paradigm, based on the co-location of storage and compute units. Ideally, it will allow to execute application-defined data- or compute-intensive operations in-situ, i.e. within (or close to) the physical data storage. Thus, Near-Data Processing seeks to minimize expensive data movement, improving performance, scalability, and resource-efficiency. Processing-in-Memory is a sub-class of Near-Data processing that targets data processing directly within memory (DRAM) chips. The effective use of Near-Data Processing mandates new architectures, algorithms, interfaces, and development toolchains.
研究动机与目标
- 解决现代数据密集型工作负载中存储、内存与CPU之间过度数据移动导致的性能瓶颈问题。
- 研究处理内存(PIM)如何通过将计算与数据在内存中就近聚合,缓解冯·诺依曼瓶颈。
- 评估PIM在具有不规则访问模式和高数据量的数据库和分析工作负载中提升可扩展性和能效的潜力。
- 研究支持PIM在数据管理系统中应用所需的体系结构和算法变更。
- 识别并分析PIM在图处理、神经网络训练和OLAP工作负载等场景中带来显著性能和效率提升的用例。
提出的方法
- 提出从传统数据到代码的模型转向代码到数据或原位处理模型,使计算在存储器内部或附近执行。
- 利用3D堆叠DRAM(HBM)和存储设备中的嵌入式处理单元(如FPGA、CPU)实现高带宽、低延迟的内存内计算。
- 设计专用PIM硬件加速器,如LiM(内存内逻辑)和TESSERACT,用于稀疏矩阵和图处理,利用数据局部性和稀疏性。
- 引入数据重排引擎(DRE),动态重构内存中的数据布局,以提升缓存效率并减少内存带宽浪费。
- 扩展OpenCL等编程模型以支持异构PIM系统,实现CPU和PIM单元之间的高效任务调度。
- 使用真实工作负载(如PageRank、广义稀疏矩阵乘法和深度学习训练)进行仿真和评估,量化PIM工作负载的性能和能效提升。
实验结果
研究问题
- RQ1处理内存在多大程度上能减少数据密集型工作负载中的数据移动并提升性能?
- RQ2PIM体系结构如何应对分析和机器学习工作负载中常见的不规则访问模式和低数据局部性?
- RQ3在将PIM集成到现代数据库和数据管理系统中时,其关键体系结构和软件接口挑战是什么?
- RQ4PIM加速器在图处理和神经网络训练中是否能相比传统CPU执行实现显著的性能和能效提升?
- RQ5如何扩展编程模型和抽象机制,以有效利用PIM硬件,同时保持可移植性和可维护性?
主要发现
- 基于PIM的系统在稀疏矩阵-矩阵乘法任务中,相比传统多线程CPU实现,性能和能效提升了两个数量级以上。
- 数据重排引擎(DRE)通过动态重构内存中的数据布局,减少了内存带宽浪费,在图处理工作负载(如PageRank)中提升了缓存效率。
- TESSERACT是一种用于图处理的PIM加速器,通过支持用户指定的访问提示和高效的内存分区,实现了高内存带宽利用率并减少了数据移动。
- Tetris是一种利用3D堆叠内存的可扩展神经网络加速器,通过将部分计算卸载到DRAM,减少了总线争用并改善了数据流,从而提升了吞吐量并降低了能耗。
- 将PIM集成到数据管理系统中需要新的数据库算子、流水线模型和原子性语义,尽管这些技术尚不成熟,但展现出强大的潜力。
- 尽管结果令人鼓舞,但目前大多数PIM研究仍局限于特定工作负载,缺乏对通用数据库操作的广泛支持,表明数据管理系统中亟需标准化的PIM原原子和接口。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。