Skip to main content
QUICK REVIEW

[论文解读] Accelerating bandwidth-bound deep learning inference with main-memory accelerators

Benjamin Y. Cho, Jeageun Jung|arXiv (Cornell University)|Nov 14, 2021
Parallel Computing and Optimization Techniques被引用 21
一句话总结

本文提出 StepStone,一种主内存加速器架构,通过在 CPU 主内存中使用存内计算(PIM)单元直接执行 GEMM 操作,加速带宽受限的深度学习推理工作负载。通过利用 GEMM 数据局部性并设计定制的地址生成逻辑,StepStone 相比快速 CPU 最高实现 16 倍加速,相比先前的主内存加速技术实现 2.4 倍加速,且在大型、高瘦矩阵上的最小延迟降低 12 倍。

ABSTRACT

Matrix-matrix multiplication operations (GEMMs) are important in many HPC and machine-learning applications. They are often mapped to discrete accelerators (e.g., GPUs) to improve performance. However, we find that large tall/skinny and fat/short matrices benefit little from discrete acceleration and also do not perform well on a CPU. Such matrices are prevalent in important workloads, such as deep-learning inference within large-scale datacenters. We demonstrate the large potential of accelerating these GEMMs with processing in the main CPU memory, where processing in memory units (PIMs) take advantage of otherwise untapped bandwidth without requiring data copies. We develop a novel GEMM execution flow and corresponding memory-side address-generation logic that exploits GEMM locality and enables long-running PIM kernels despite the complex address-mapping functions employed by the CPU. Our evaluation of StepStone variants at the channel, device, and within-device PIM levels demonstrate 12X better minimum latency than a CPU and 2.8X greater throughput for strict query latency constraints. End-to-end performance analysis of recent recommendation and language models shows that StepStone outperforms a fast CPU by up to 16X and also the best prior main-memory acceleration approaches by up to 2.4X.

研究动机与目标

  • 为解决在 CPU 和独立加速器上处理大型、高瘦/细长及宽短 GEMM 操作时性能不佳的问题。
  • 探索存内计算(PIM)在加速传统加速方式难以有效支持的带宽受限 GEMM 工作负载方面的潜力。
  • 设计一种新颖的 GEMM 执行流程和内存侧地址生成逻辑,实现在复杂 CPU 地址映射下长期运行的 PIM 内核。
  • 在多个 PIM 部署层级——通道级、设备级和设备内级——评估 StepStone,并在真实模型中展示端到端性能提升。

提出的方法

  • 设计一种新颖的 GEMM 执行流程,利用深度学习推理中常见的大型、高瘦/细长和宽短矩阵中的数据局部性。
  • 开发定制的内存侧地址生成逻辑,在支持复杂 CPU 地址映射函数的同时,实现长期运行的 PIM 内核。
  • 将 PIM 单元直接集成到主内存子系统中,消除数据移动并利用未开发的内存带宽。
  • 在三个粒度层级上评估 StepStone:通道级、设备级和设备内级 PIM 集成。
  • 优化 PIM 内核执行,以在严格查询延迟约束下最小化延迟并最大化吞吐量。
  • 对真实推荐和语言模型进行端到端性能分析,以验证系统级性能提升。

实验结果

研究问题

  • RQ1存内计算(PIM)架构能否有效加速深度学习推理工作负载中的带宽受限 GEMM 操作?
  • RQ2尽管现代 CPU 使用复杂的地址映射函数,如何使 PIM 内核实现长期运行?
  • RQ3与 CPU 和独立加速器相比,将 PIM 单元集成到主内存子系统中能带来多大的性能提升?
  • RQ4StepStone 的设计在不同 PIM 部署层级——通道级、设备级和设备内级——上如何扩展?
  • RQ5真实推荐和语言模型在多大程度上受益于主内存中的 GEMM 加速?

主要发现

  • StepStone 在带宽受限的 GEMM 操作上相比 CPU 实现 12 倍更低的最小延迟,显著降低了延迟。
  • 在严格查询延迟约束下,StepStone 的吞吐量相比 CPU 提高 2.8 倍,展现出更高的效率。
  • 端到端评估显示,StepStone 在真实推荐和语言模型中相比快速 CPU 最高实现 16 倍加速。
  • StepStone 相比最佳的先前主内存加速方法,性能最高提升 2.4 倍。
  • 所提出的地址生成逻辑成功实现了在复杂 CPU 地址映射下长期运行的 PIM 内核,为不规则工作负载解锁了 PIM 潜力。
  • 在通道级、设备级和设备内级 PIM 层级的评估中均确认了稳定的性能提升,验证了该设计的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。