Skip to main content
QUICK REVIEW

[论文解读] Automated Design Space Exploration of CGRA Processing Element Architectures using Frequent Subgraph Analysis

Jackson Melchert, Kathleen Feng|arXiv (Cornell University)|Apr 29, 2021
Embedded Systems Design Techniques参考文献 16被引用 5
一句话总结

本文提出了一种基于频繁子图分析的粗粒度可重构阵列(CGRA)处理单元(PE)自动化设计空间探索框架,通过挖掘应用中的常见计算模式,合并这些子图以生成专用PE。该方法使PE的能效比最高提升10.5倍,面积缩小9.1倍,显著提升了图像处理和机器学习工作负载的性能与效率。

ABSTRACT

The architecture of a coarse-grained reconfigurable array (CGRA) processing element (PE) has a significant effect on the performance and energy efficiency of an application running on the CGRA. This paper presents an automated approach for generating specialized PE architectures for an application or an application domain. Frequent subgraphs mined from a set of applications are merged to form a PE architecture specialized to that application domain. For the image processing and machine learning domains, we generate specialized PEs that are up to 10.5x more energy efficient and consume 9.1x less area than a baseline PE.

研究动机与目标

  • 解决为特定应用领域手动设计高能效CGRA PE的挑战。
  • 降低探索庞大CGRA PE架构空间所需的设计开销和时间。
  • 实现专用PE的自动化生成,以优化面积、能耗和性能。
  • 支持跨应用的PE专用化,以在多个工作负载间平衡通用性与效率。
  • 将硬件生成与编译器综合整合到统一、敏捷的工具链中,实现端到端评估。

提出的方法

  • 应用频繁子图挖掘,从某一领域(如图像处理或机器学习)的代表性应用集中提取常见的计算子图。
  • 将最频繁出现的子图合并为统一的PE架构,以支持目标应用中的主要操作。
  • 以合并后的子图结构为模板,生成具有优化算术单元和内部互连路由的专用PE。
  • 自动生成包含专用PE、互连和配置逻辑的完整CGRA架构。
  • 自动生成针对特定领域的编译器,使用专用PE指令集将应用映射到新CGRA上。
  • 通过周期精确仿真和综合工具,对生成的CGRA设计在面积、能耗、性能等多个指标上进行评估。

实验结果

研究问题

  • RQ1如何利用频繁子图分析识别领域内应用之间的常见计算模式?
  • RQ2将频繁子图合并后,能否生成在多个应用间实现效率与通用性平衡的PE架构?
  • RQ3与通用基线PE相比,专用PE在面积和能效方面能获得多大提升?
  • RQ4与针对单一应用的PE专用化相比,跨应用PE专用化在性能和资源使用方面表现如何?
  • RQ5所提出的框架能否在极少人工干预下生成CGRA和编译器栈,同时实现接近ASIC级别的能效?

主要发现

  • 在图像处理中,专用PE相比基线PE实现最高10.5倍的能效提升和9.1倍的面积缩减。
  • 针对摄像头流水线应用的专用PE相比基线PE实现最高8.3倍的能耗降低和3.4倍的面积缩减。
  • 专用PE的最大工作频率从基线的1.43 GHz提升至2 GHz,表明时序和性能得到改善。
  • 通用图像处理PE(PE IP)在四个图像处理应用中相比基线实现29.6–32.5%的面积降低和44.5–65.25%的能耗降低。
  • 针对特定应用的PE(如拉普拉斯金字塔)相比通用PE IP实现38.6%的面积降低和33.0%的能耗降低,证明了针对单一应用优化的优势。
  • 在机器学习领域,通用ML PE(PE ML)相比基线实现最高60.15%的能耗降低,并且整体能耗比基线CGRA降低22.1%,接近定制加速器Simba的能效水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。