[논문 리뷰] High Performance Computing with FPGAs and OpenCL
이 논문은 OpenCL 및 고수준 합성(HLS)을 통해 가속화된 FPGAs가 고성능 계산(HPC) 분야에서 CPU와 GPU를 능가할 수 있음을 보여준다. 특히 스텐실 계산에 있어서, 공간적 및 시간적 블로킹을 조합함으로써, 입력 크기나 스텐실 순서에 제약이 없는 2D 및 3D 스텐실에 대해 지금까지 보고된 바 중 가장 높은 단일 FPGA 성능을 달성하였으며, 높은 에너지 효율성과 다양한 워크로드에서의 확장성도 확보하였다.
In this work we evaluate the potential of FPGAs for accelerating HPC workloads as a more power-efficient alternative to GPUs. Using High-Level Synthesis and a large set of optimization techniques, we show that FPGAs can achieve better performance than CPUs, and better power efficiency than both CPUs and GPUs for typical HPC workloads. Furthermore, we show that for the specific case of stencil computation, the unique architectural advantages of FPGAs allow them to surpass high-end CPU, Xeon Phi and GPU devices. Unlike previous work, our FPGA-based stencil accelerator combines spatial blocking with temporal blocking to achieve high performance without restricting input size. With support for high-order stencils, we achieve the highest single-FPGA performance for 2D and 3D stencil computation of any order, to this day.
연구 동기 및 목표
- HPC 워크로드에 대해 GPU와 CPU의 전력 효율적인 대안으로서 FPGA를 평가하는 것.
- 이전 FPGA 가속기들이 입력 크기나 스텐실 순서에 제약을 둔 점을 극복하는 것.
- OpenCL 및 고수준 합성을 사용하여 스텐실 계산을 위한 고성능, 확장 가능한 FPGA 기반 가속기를 개발하는 것.
- 최신 CPU, GPU, Xeon Phi 장치들과 비교해 뛰어난 성능과 에너지 효율성을 달성하는 것.
- 입력 크기 제약 없이 고차수 스텐실을 지원함으로써 더 넓은 HPC 적용 가능성을 확보하는 것.
제안 방법
- OpenCL 커널에서 FPGA 하드웨어를 생성하기 위해 고수준 합성(HLS)을 활용하여 빠른 프로토타이핑과 이식성을 확보하였다.
- 내장 블록 램과 외부 DDR 메모리를 조합한 하이브리드 메모리 액세스 전략을 구현하여 데이터 국소성을 최적화하였다.
- 공간 블로킹을 적용하여 계산 영역을 내장 메모리에 맞는 타일로 분할함으로써 외부 메모리 액세스를 감소시켰다.
- 시간 블로킹을 통합하여 동일한 타일 내에서 여러 연산 간에 데이터를 재사용함으로써 중복된 메모리 이동을 최소화하였다.
- 데이터 수준 병렬성과 높은 산술 집중도를 활용한 파이프라인화되고 병렬적인 아키텍처를 설계하여 스텐실 계산을 최적화하였다.
- OpenCL 커널을 사용해 데이터 이동과 메모리 계층을 명시적으로 제어함으로써 세밀한 최적화를 가능하게 하였다.
실험 결과
연구 질문
- RQ1FPGAs는 일반적인 HPC 워크로드에서 CPU와 GPU보다 더 높은 성능과 뛰어난 전력 효율성을 달성할 수 있는가?
- RQ2입력 크기 제약 없이 스텐실 계산에 대해 공간적 및 시간적 블로킹을 조합함으로써 FPGA 성능이 어떻게 향상되는가?
- RQ32D 및 3D 스텐실 계산에서 다양한 순서에 대해 고성능 CPU, Xeon Phi, GPU와 비교해 FPGA는 어느 정도 뛰어난 성능을 보이는가?
- RQ4HPC 분야에서 FPGA 가속화에 OpenCL 및 HLS를 사용할 경우 성능 및 에너지 효율성 향상은 어느 정도인가?
- RQ5단일 FPGA 가속기가 다양한 문제 크기에서 고차수 스텐실을 효율적으로 처리할 수 있는가?
주요 결과
- 이 FPGA 가속기는 어떤 순서의 2D 및 3D 스텐실 계산에 대해서도 지금까지 보고된 바 중 가장 높은 단일 FPGA 성능를 달성하였다.
- 2D 및 3D 스텐실 계산에서 고성능 CPU, Xeon Phi, GPU 장치들과 비교해 성능 및 에너지 효율성 측면에서 모두 FPGA가 뛰어난 성능을 보였다.
- 공간적 및 시간적 블로킹의 조합으로 입력 크기 제약 없이 고성능을 달성하였으며, 이는 이전 FPGA 가속기에서의 주요 제약 요소였다.
- 설계는 뛰어난 에너지 효율성을 확보하였으며, HPC 워크로드에서 GPU 및 CPU보다 더 전력 효율적인 대안으로서 FPGA의 잠재력을 입증하였다.
- OpenCL 기반의 HLS 접근법은 복잡한 스텐실 커널에서 경쟁력 있는 성능를 달성하면서도 빠른 개발과 이식성을 가능하게 하였다.
- 가속기는 고차수 스텐실을 효과적으로 지원하여 과학 계산 워크로드에 더 넓은 적용 가능성을 제공하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.