Skip to main content
QUICK REVIEW

[论文解读] High Performance Computing with FPGAs and OpenCL

Hamid Reza Zohouri|arXiv (Cornell University)|Oct 23, 2018
Parallel Computing and Optimization Techniques参考文献 58被引用 10
一句话总结

本文展示了通过 OpenCL 和高层次综合(HLS)加速的 FPGA 可在高性能计算(HPC)中超越 CPU 和 GPU,尤其在稀疏计算(stencil computations)方面表现优异。通过结合空间与时间分块技术,作者实现了迄今为止针对任意阶数的 2D 和 3D 稀疏计算中单个 FPGA 的最高性能,同时在不同工作负载下展现出卓越的能效比与可扩展性。

ABSTRACT

In this work we evaluate the potential of FPGAs for accelerating HPC workloads as a more power-efficient alternative to GPUs. Using High-Level Synthesis and a large set of optimization techniques, we show that FPGAs can achieve better performance than CPUs, and better power efficiency than both CPUs and GPUs for typical HPC workloads. Furthermore, we show that for the specific case of stencil computation, the unique architectural advantages of FPGAs allow them to surpass high-end CPU, Xeon Phi and GPU devices. Unlike previous work, our FPGA-based stencil accelerator combines spatial blocking with temporal blocking to achieve high performance without restricting input size. With support for high-order stencils, we achieve the highest single-FPGA performance for 2D and 3D stencil computation of any order, to this day.

研究动机与目标

  • 评估 FPGA 作为 HPC 工作负载下 GPU 和 CPU 的节能替代方案。
  • 克服以往 FPGA 加速器在输入大小或稀疏阶数方面受到限制的局限。
  • 利用 OpenCL 和高层次综合技术,开发一种高性能、可扩展的基于 FPGA 的稀疏计算加速器。
  • 与最先进的 CPU、GPU 和 Xeon Phi 设备相比,实现更优的性能与能效。
  • 在无输入大小限制的前提下支持高阶稀疏计算,从而拓展其在 HPC 领域的应用范围。

提出的方法

  • 采用高层次综合(HLS)将 OpenCL 内核转换为 FPGA 硬件,实现快速原型设计与可移植性。
  • 实施混合内存访问策略,结合片上块 RAM 与片外 DDR 内存,以优化数据局部性。
  • 应用空间分块技术,将计算域划分为可容纳于片上内存的块(tiles),减少对片外内存的访问。
  • 集成时间分块机制,使同一块内的数据可在多次操作中重复使用,降低冗余内存传输。
  • 设计一种流水线化、并行化的架构用于稀疏计算,充分利用数据级并行性与高算术强度。
  • 使用 OpenCL 内核表达算法,显式控制数据移动与内存层次结构,实现细粒度优化。

实验结果

研究问题

  • RQ1FPGA 是否能在典型 HPC 工作负载下实现比 CPU 和 GPU 更高的性能与更好的能效?
  • RQ2在不施加输入大小限制的前提下,结合空间与时间分块如何提升 FPGA 在稀疏计算中的性能?
  • RQ3在不同阶数的 2D 和 3D 稀疏计算中,FPGA 相较于高端 CPU、Xeon Phi 和 GPU 能实现多大程度的性能超越?
  • RQ4在 HPC 中采用 OpenCL 与 HLS 进行 FPGA 加速,能带来多大的性能与能效提升?
  • RQ5单个 FPGA 加速器能否在不同问题规模下高效处理高阶稀疏计算?

主要发现

  • 该 FPGA 加速器在任意阶数的 2D 和 3D 稀疏计算中,实现了迄今为止报道的最高单 FPGA 性能。
  • 在 2D 和 3D 稀疏计算中,FPGA 在性能与能效方面均优于高端 CPU、Xeon Phi 和 GPU 设备。
  • 空间与时间分块的结合实现了高性能,且未对输入大小施加限制,解决了以往 FPGA 加速器的关键瓶颈。
  • 该设计实现了卓越的能效比,证明 FPGA 是 HPC 工作负载下比 GPU 和 CPU 更节能的替代方案。
  • 基于 OpenCL 的 HLS 方法在实现复杂稀疏核的高性能的同时,实现了快速开发与可移植性。
  • 该加速器能有效支持高阶稀疏计算,显著拓展了其在科学计算工作负载中的适用范围。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。