Skip to main content
QUICK REVIEW

[论文解读] Enabling Automated FPGA Accelerator Optimization Using Graph Neural Networks

Atefeh Sohrabizadeh, Yunsheng Bai|arXiv (Cornell University)|Nov 17, 2021
Embedded Systems Design Techniques参考文献 43被引用 5
一句话总结

本文提出 GNN-DSE,一种基于图神经网络(GNN)的代理模型,可在毫秒内预测FPGA高层次综合(HLS)性能,实现快速设计空间探索(DSE)。通过将程序建模为包含控制流、数据流、调用关系和pragma信息的图结构,GNN能够以高精度估算延迟、资源使用量等目标,仅需极少的训练数据即可在未见过的核函数上实现接近最优的结果。

ABSTRACT

High-level synthesis (HLS) has freed the computer architects from developing their designs in a very low-level language and needing to exactly specify how the data should be transferred in register-level. With the help of HLS, the hardware designers must describe only a high-level behavioral flow of the design. Despite this, it still can take weeks to develop a high-performance architecture mainly because there are many design choices at a higher level that requires more time to explore. It also takes several minutes to hours to get feedback from the HLS tool on the quality of each design candidate. In this paper, we propose to solve this problem by modeling the HLS tool with a graph neural network (GNN) that is trained to be used for a wide range of applications. The experimental results demonstrate that by employing the GNN-based model, we are able to estimate the quality of design in milliseconds with high accuracy which can help us search through the solution space very quickly.

研究动机与目标

  • 解决FPGA高层次综合(HLS)中因每次设计评估需数分钟至数小时而产生的长反馈周期问题。
  • 克服HLS优化中因大量pragma组合导致的设计空间指数级增长问题。
  • 实现在不依赖缓慢HLS工具调用的前提下,自动化且可扩展的设计空间探索(DSE)。
  • 开发一种可迁移的模型,将已训练核函数的知识泛化至新出现的、未见过的应用程序。
  • 构建一种与工具无关的框架,在保持对Pareto最优设计点高预测精度的同时,加速DSE过程。

提出的方法

  • 将FPGA设计表示为异构图,编码控制流、数据流、调用图和pragma注释信息。
  • 使用跳跃知识网络(JKN)、节点注意力机制和多头预测训练GNN,以捕捉设计参数之间复杂的非线性交互关系。
  • 将GNN作为代理模型,实现每项设计在毫秒内预测关键HLS目标(如延迟、资源使用量)。
  • 实现一种基于启发式的DSE框架,通过HLS工具评估获得的高质量设计,迭代扩展训练数据库。
  • 通过在原始训练集之外的新核函数上微调GNN,利用迁移学习实现跨领域的泛化能力。
  • 将GNN模型集成至DSE流程中,通过基于预测性能对候选设计进行排序,搜索Pareto最优设计。

实验结果

研究问题

  • RQ1基于GNN的代理模型是否能以毫秒级精度预测HLS性能指标(如延迟、资源使用量),从而替代耗时的HLS工具调用?
  • RQ2在有限核函数集上训练的GNN模型,能在多大程度上泛化至不同领域中未见过的新核函数?
  • RQ3所提出的DSE框架在寻找Pareto最优设计方面,相较于暴力搜索或启发式探索方法,效果如何?
  • RQ4该模型在处理如循环展开因子和流水线化等pragma参数带来的非单调且相关的影响时,是否具备高效处理能力?
  • RQ5迁移学习的集成是否能显著减少新应用所需的HLS评估次数?

主要发现

  • GNN-DSE模型在不到1毫秒内完成HLS性能预测,精度高,将评估时间从数分钟缩短至毫秒级。
  • 经过三轮数据库扩展后,GNN-DSE在最佳初始设计基础上实现了平均1.8倍的加速,所有核函数的性能均得到提升或与基线持平。
  • 对于2mm核函数,GNN-DSE在60分钟内探索了49200万项设计点中的78676项,与AutoDSE在21小时探索后相比,速度提升达0.98倍。
  • 在未见核函数(gesummv、bicg、2mm)上,GNN-DSE性能几乎与AutoDSE持平(分别实现18倍、26倍、350倍加速),即使未参与训练,也展现出强大的泛化能力。
  • bicg核函数实现了1.05倍的加速,优于AutoDSE的1.05倍,归因于对设计空间的全面探索,凸显了GNN-DSE在DSE中的高效性。
  • 该模型仅需少量训练样本即可有效泛化至新核函数,表明迁移学习显著降低了新应用中昂贵HLS评估的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。