Skip to main content
QUICK REVIEW

[论文解读] Sparse Matrix Multiplication on CAM Based Accelerator

Leonid Yavits, Ran Ginosar|arXiv (Cornell University)|May 28, 2017
Network Packet Processing and Optimization参考文献 14被引用 11
一句话总结

本文提出了一种基于内容可寻址存储器(Content Addressable Memory, CAM)和阻变内容可寻址存储器(Resistive CAM, ReCAM)的新型加速器架构,用于加速压缩稀疏行(CSR)格式下的稀疏矩阵-向量乘法与矩阵-矩阵乘法。通过功能仿真,基于ReCAM的设计相比现有实现,功耗效率提高了两个数量级,显著提升了稀疏线性代数工作负载的性能。

ABSTRACT

Sparse matrix multiplication is an important component of linear algebra computations. In this paper, an architecture based on Content Addressable Memory (CAM) and Resistive Content Addressable Memory (ReCAM) is proposed for accelerating sparse matrix by sparse vector and matrix multiplication in CSR format. Using functional simulation, we show that the proposed ReCAM-based accelerator exhibits two orders of magnitude higher power efficiency as compared to existing sparse matrix-vector multiplication implementations.

研究动机与目标

  • 为科学计算和机器学习中日益增长的稀疏矩阵运算计算需求提供解决方案。
  • 克服传统冯·诺依曼架构在处理稀疏矩阵典型不规则内存访问模式时的低效性。
  • 设计一种专用硬件加速器,利用CAM和ReCAM实现高吞吐量、低功耗的稀疏矩阵乘法。
  • 评估所提出架构在稀疏矩阵-向量乘法和矩阵-矩阵乘法工作负载下的功耗效率与性能表现。
  • 展示基于ReCAM的加速在稀疏线性代数内核中的可行性与优势。

提出的方法

  • 该架构使用内容可寻址存储器(CAM)对稀疏矩阵非零元素进行基于内容的查找,从而减少内存访问开销。
  • 采用阻变内容可寻址存储器(ReCAM)以内容可寻址、内存内计算的方式存储和处理稀疏矩阵数据。
  • 系统以压缩稀疏行(Compressed Sparse Row, CSR)格式处理稀疏矩阵,实现对非零元素的高效索引与遍历。
  • 通过功能仿真评估加速器在真实世界稀疏矩阵工作负载下的性能与功耗效率。
  • 通过在硬件中直接匹配矩阵索引,利用数据级并行性,避免冗余内存访问。
  • 基于ReCAM的实现用关联式存储结构替代传统内存层次,以加速稀疏运算。

实验结果

研究问题

  • RQ1基于CAM的加速器是否能在稀疏矩阵乘法中相比传统架构实现显著更高的功耗效率?
  • RQ2基于ReCAM的设计在CSR格式稀疏矩阵运算中的吞吐量与能量效率表现如何?
  • RQ3内容可寻址存储器在多大程度上能减少稀疏线性代数内核中的内存访问开销?
  • RQ4与传统的SRAM实现相比,使用ReCAM在稀疏矩阵-向量乘法中能带来多大的性能与能效增益?
  • RQ5所提出的架构在不同稀疏矩阵密度和稀疏模式下是否具备良好的可扩展性?

主要发现

  • 基于ReCAM的加速器在功耗效率方面相比现有稀疏矩阵-向量乘法实现高出约100倍。
  • 功能仿真结果表明,基于CAM的方法显著降低了内存访问延迟与带宽压力。
  • 该架构通过基于内容的寻址方式,有效处理了稀疏矩阵固有的不规则内存访问模式。
  • 该设计在不同稀疏矩阵密度和稀疏模式下表现出良好的可扩展性。
  • ReCAM的使用实现了内存内计算,减少了数据移动,提升了能效。
  • 结果表明,基于关联式存储的加速是实现能效优化稀疏线性代数处理的可行路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。