Skip to main content
QUICK REVIEW

[论文解读] TAPA: A Scalable Task-Parallel Dataflow Programming Framework for Modern FPGAs with Co-Optimization of HLS and Physical Design

Licheng Guo, Yuze Chi|arXiv (Cornell University)|Sep 6, 2022
Embedded Systems Design Techniques参考文献 71被引用 4
一句话总结

TAPA 是一种面向现代 FPGA 的任务并行数据流编程框架,通过粗粒度布局规划对高层次综合(HLS)和物理设计进行联合优化,显著提升了频率。它在 43 个设计上将平均频率从 147 MHz 提升至 297 MHz(提升 102%),面积开销可忽略不计,并使 16 个此前无法布线的设计重新实现时序收敛。

ABSTRACT

In this paper, we propose TAPA, an end-to-end framework that compiles a C++ task-parallel dataflow program into a high-frequency FPGA accelerator. Compared to existing solutions, TAPA has two major advantages. First, TAPA provides a set of convenient APIs that allow users to easily express flexible and complex inter-task communication structures. Second, TAPA adopts a coarse-grained floorplanning step during HLS compilation for accurate pipelining of potential critical paths. In addition, TAPA implements several optimization techniques specifically tailored for modern HBM-based FPGAs. In our experiments with a total of 43 designs, we improve the average frequency from 147 MHz to 297 MHz (a 102% improvement) with no loss of throughput and a negligible change in resource utilization. Notably, in 16 experiments we make the originally unroutable designs achieve 274 MHz on average. The framework is available at https://github.com/UCLA-VAST/tapa and the core floorplan module is available at https://github.com/UCLA-VAST/AutoBridge.

研究动机与目标

  • 应对现代异构 FPGA(具有多芯片架构和 HBM)在高层次综合(HLS)中日益严峻的时序收敛挑战。
  • 通过将布局规划集成到 HLS 编译流程中,弥合 HLS 与物理设计之间的脱节。
  • 通过联合优化 HLS 和物理设计,在配备 HBM 的 FPGA 上实现可扩展的、高频的任务并行数据流程序。
  • 提供一种实用且用户友好的 API,用于在 C++ 中表达复杂的任务间通信模式。
  • 恢复因关键路径延迟而此前无法布线的设计的时序收敛。

提出的方法

  • 在 HLS 编译过程中引入粗粒度布局规划步骤,以指导跨芯片和长距离互连的关键路径准确流水化。
  • 通过利用布局规划信息,在长距离、关键时序路径上插入寄存器,尤其是跨芯片边界路径,实现 HLS 和物理设计的联合优化。
  • 实现 HBM 端口的自动绑定以及定制化编程接口,以最小化 HBM I/O 模块的面积开销。
  • 探索布局规划解空间,联合优化任务放置与互连布线,以改善时序性能。
  • 采用保守的延迟平衡策略,对汇合路径进行处理,以在提升频率的同时保持吞吐量。
  • 与商业 FPGA 工具链集成,以确保兼容性与实际部署可行性。

实验结果

研究问题

  • RQ1如何联合优化 HLS 和物理设计,以改善现代多芯片 FPGA 中的时序收敛?
  • RQ2在 HLS 编译过程中引入粗粒度布局规划对频率和可布线性有何影响?
  • RQ3联合优化技术能否有效应对 HBM 和异构资源引入的 FPGA 时序挑战?
  • RQ4TAPA 在多大程度上能恢复此前无法布线的设计的时序收敛?
  • RQ5将布局规划与 HLS 集成,对任务并行数据流程序的性能和资源利用率有何影响?

主要发现

  • TAPA 将 43 个设计的平均频率从 147 MHz 提升至 297 MHz,提升幅度达 102%,且吞吐量无损失。
  • 在 16 项实验中,TAPA 使此前无法布线的设计成功实现时序收敛,平均频率达到 274 MHz。
  • 该框架在显著提升时序性能的同时,保持了资源利用率的微小变化。
  • HLS 与物理设计的联合优化使长距离跨芯片互连的流水化成为可能,而这些互连是现代 FPGA 中的主要时序瓶颈。
  • TAPA 的布局规划与 HBM 感知优化显著降低了 HBM I/O 模块的面积开销,并提升了布线效率。
  • 该框架已在多个实际项目中成功应用,证明了其在高性能 FPGA 加速中的实用性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。