Skip to main content
QUICK REVIEW

[论文解读] Transaction-level Model Simulator for Communication-Limited Accelerators

Sunwoo Kim, Jooho Wang|arXiv (Cornell University)|Jul 29, 2020
Advanced Memory and Neural Computing参考文献 24被引用 9
一句话总结

本文提出 AccTLMSim,一种用于卷积神经网络(CNN)加速器的预RTL周期精确的SystemC TLM仿真器,通过考虑DRAM延迟和总线协议开销来建模通信带宽。该仿真器通过一种新颖的性能估计模型,实现了快速且精确的设计空间探索——在数十分钟内完成数百万个架构选项的分析,其性能估计的准确性和速度均优于传统方法。

ABSTRACT

Rapid design space exploration in early design stage is critical to algorithm-architecture co-design for accelerators. In this work, a pre-RTL cycle-accurate accelerator simulator based on SystemC transaction-level modeling (TLM), AccTLMSim, is proposed for convolutional neural network (CNN) accelerators. The accelerator simulator keeps track of each bus transaction between accelerator and DRAM, taking into account the communication bandwidth. The simulation results are validated against the implementation results on the Xilinx Zynq. Using the proposed simulator, it is shown that the communication bandwidth is severely affected by DRAM latency and bus protocol overhead. In addition, the loop tiling is optimized to maximize the performance under the constraint of on-chip SRAM size. Furthermore, a new performance estimation model is proposed to speed up the design space exploration. Thanks to the proposed simulator and performance estimation model, it is possible to explore a design space of millions of architectural options within a few tens of minutes.

研究动机与目标

  • 解决缺乏能够准确建模CNN加速器中通信瓶颈的预RTL仿真器的问题。
  • 克服现有仿真器的局限性,后者假设通信带宽为静态值,忽略了DRAM延迟和总线协议开销带来的动态影响。
  • 在片上SRAM容量受限的条件下,实现通信受限型CNN加速器的高效且精确的设计空间探索。
  • 开发一种性能估计模型,通过加速探索过程同时保持与周期精确仿真相当的高精度。
  • 优化循环分块策略,包括跨多个卷积层的无约束分块,以在SRAM大小限制下最大化性能。

提出的方法

  • 设计一种基于SystemC的事务级模型(AccTLMSim),以周期精确的方式跟踪加速器与DRAM之间的所有总线事务。
  • 在仿真中引入真实的DRAM延迟和AXI总线协议开销,以建模动态通信带宽。
  • 通过与Xilinx Zynq FPGA实现结果对比,验证仿真器的准确性。
  • 基于仿真数据提取的经验缩放因子,提出一种新型性能估计模型,取代静态假设。
  • 将该估计模型集成到仿真器中,用于在完整仿真前过滤设计空间(例如前0.1%),从而大幅减少探索时间。
  • 扩展框架以支持跨多个卷积层的无约束循环分块,实现每层的分块大小和展开因子的独立优化。

实验结果

研究问题

  • RQ1DRAM延迟和总线协议开销如何影响CNN加速器中的有效通信带宽?
  • RQ2基于TLM的周期精确仿真器是否能在无RTL实现的情况下准确建模通信受限的性能?
  • RQ3与传统模型相比,所提出的性能估计模型在设计空间探索中的准确性和速度表现如何?
  • RQ4与受限分块相比,跨多个卷积层使用无约束循环分块能带来多大的性能提升?
  • RQ5所提出的估计模型在大规模设计空间探索中,能在多大程度上减少探索时间,同时保持精度?

主要发现

  • CNN加速器中的通信带宽受DRAM延迟和总线协议开销的动态限制,而不仅仅是峰值带宽。
  • 所提出的仿真器准确反映了实际性能,经Xilinx Zynq FPGA结果验证。
  • 新型性能估计模型将设计空间探索时间减少了数个数量级,同时保持高精度,即使在仅筛选前1%选项的情况下,也优于传统模型。
  • 与受限分块相比,跨多个层的无约束循环分块通过每层独立优化分块大小,最高可将最大性能提升25.5%。
  • 所提出的模型使在数十分钟内探索数百万个架构选项成为可能,使大规模优化成为现实。
  • 传统模型中经验性选择的缩放因子会导致显著的性能下降,尤其当SRAM大小超过15k像素/权重时,凸显了精确建模的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。