Skip to main content
QUICK REVIEW

[论文解读] Benchmarking and modeling of analog and digital SRAM in-memory computing architectures

Pouya Houshmand, Jiacong Sun|arXiv (Cornell University)|May 25, 2023
Advanced Memory and Neural Computing被引用 6
一句话总结

本文提出了一种统一的分析成本模型,用于基准测试模拟(AIMC)和数字(DIMC)存内计算架构,实现了对多样化设计的公平、定量比较。该模型集成于ZigZag设计空间探索(DSE)框架中,揭示了在高权重重用卷积层(如ResNet8)中,大尺寸AIMC阵列表现优异;而在低权重重用、逐点卷积层(如MobileNetV1)中,较小且分布式的DIMC宏单元则表现更优,凸显了阵列尺寸、数据流设计与能效之间的关键权衡。

ABSTRACT

In-memory-computing is emerging as an efficient hardware paradigm for deep neural network accelerators at the edge, enabling to break the memory wall and exploit massive computational parallelism. Two design models have surged: analog in-memory-computing (AIMC) and digital in-memory-computing (DIMC), offering a different design space in terms of accuracy, efficiency and dataflow flexibility. This paper targets the fair comparison and benchmarking of both approaches to guide future designs, through a.) an overview of published architectures; b.) an analytical cost model for energy and throughput; c.) scheduling of workloads on a variety of modeled IMC architectures for end-to-end network efficiency analysis, offering valuable workload-hardware co-design insights.

研究动机与目标

  • 为尽管技术与设计参数各异,仍能实现模拟与数字存内计算(AIMC/DIMC)架构的公平、定量基准测试。
  • 开发一个统一的分析成本模型,用于估算能效与吞吐量,并在已发表的AIMC与DIMC设计中进行验证。
  • 将该模型集成至ZigZag设计空间探索(DSE)框架中,实现对真实DNN工作负载的端到端效率分析。
  • 通过在多种架构与tinyMLPerf基准测试中评估空间与时间映射,提供工作负载-硬件协同设计洞见。
  • 识别在不同网络特性与阵列配置下,AIMC与DIMC范式的优势与局限。

提出的方法

  • 作者从10个已发表的AIMC与DIMC设计中提取架构参数(阵列尺寸、宏单元数量、工艺节点、精度),涵盖不同制程技术。
  • 开发统一的分析成本模型以估算能效与吞吐量,并在设计点上进行验证,相对误差约为15%。
  • 模型整合了宏单元级能耗与外存层级的数据移动成本,考虑了操作数重用与外围电路开销。
  • 将模型集成至ZigZag DSE框架中,以探索每层网络与硬件配置下的最优空间与时间映射。
  • 在tinyMLPerf基准模型(如DeepAutoEncoder、ResNet8、MobileNetV1、DS-CNN)上执行工作负载评估,以衡量端到端效率。
  • 分析不同阵列尺寸与宏单元数量下的能效分解与外存数据流量,揭示利用率与开销之间的权衡。

实验结果

研究问题

  • RQ1不同AIMC与DIMC架构参数(阵列尺寸、宏单元数量、工艺节点)如何影响真实DNN工作负载下的能效与吞吐量?
  • RQ2在何种场景下大阵列AIMC优于小尺寸、分布式DIMC架构,反之亦然?
  • RQ3空间与时间映射的选择如何影响不同DNN层中IMC加速器的能效?
  • RQ4在不同IMC设计点中,宏单元级能效与片外数据移动开销之间的相对权衡为何?
  • RQ5统一分析模型在预测异构AIMC与DIMC设计性能方面,其准确性在多大程度上成立?

主要发现

  • 在高权重重用层(如ResNet8)中,大尺寸AIMC阵列可实现峰值能效,因权重在特征图像素间重用,分摊了写入开销。
  • 对于仅含全连接层的网络(如DeepAutoEncoder),AIMC的优势消失,因缺乏权重重用,频繁重写权重导致高能耗。
  • 在低权重重用、逐点卷积与深度可分离卷积层(如MobileNetV1、DS-CNN)中,较小且分布式的DIMC宏单元优于大阵列,因大阵列在这些场景中存在计算利用率不足的问题。
  • 增加宏单元数量可提升非IMC维度(如OX、OY、G)的空间并行度,但会增加特征图与部分和数据的片外数据移动,提升能耗开销。
  • 统一分析模型在验证已发表设计点时,相对误差约为15%,展现出在跨架构基准测试中强大的准确性。
  • 将模型集成至ZigZag框架后,可系统性探索最优映射,揭示出最优设计高度依赖于工作负载特性与层类型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。