[논문 리뷰] Accelerating BLAS on Custom Architecture through Algorithm-Architecture Co-design
이 논문은 기본 선형 대수 하위프로그램(BLAS)을 코arse-grained 재구성 가능한 아키텍처(REDEFINE CGRA)에서 가속화하기 위한 공동 설계 접근법을 제시한다. 이는 레벨-1, -2, -3 BLAS 연산을 위해 맞춤형 처리 요소(PE)를 최적화한 것이다. PE는 이중 정밀도 GEMM에서 이론적 최고 성능의 74%, GEMV에서 40%, 내적에서 20%를 달성하여 인텔, 네이버, GPU 및 FPGA 플랫폼 대비 3–140×의 성능 향상을 이끌었으며, 35.7 Gflops/watt의 에너지 효율성을 제공하여 알고리즘-아키텍처 공동 설계를 통한 확장 가능한 성능을 입증한다.
Basic Linear Algebra Subprograms (BLAS) play key role in high performance and scientific computing applications. Experimentally, yesteryear multicore and General Purpose Graphics Processing Units (GPGPUs) are capable of achieving up to 15 to 57% of the theoretical peak performance at 65W to 240W respectively for compute bound operations like Double/Single Precision General Matrix Multiplication (XGEMM). For bandwidth bound operations like Single/Double precision Matrix-vector Multiplication (XGEMV) the performance is merely 5 to 7% of the theoretical peak performance in multicores and GPGPUs respectively. Achieving performance in BLAS requires moving away from conventional wisdom and evolving towards customized accelerator tailored for BLAS through algorithm-architecture co-design. In this paper, we present acceleration of Level-1 (vector operations), Level-2 (matrix-vector operations), and Level-3 (matrix-matrix operations) BLAS through algorithm architecture co-design on a Coarse-grained Reconfigurable Architecture (CGRA). We choose REDEFINE CGRA as a platform for our experiments since REDEFINE can be adapted to support domain of interest through tailor-made Custom Function Units (CFUs). For efficient sequential realization of BLAS, we present design of a Processing Element (PE) and perform micro-architectural enhancements in the PE to achieve up-to 74% of the theoretical peak performance of PE in DGEMM, 40% in DGEMV and 20% in double precision inner product (DDOT). We attach this PE to REDEFINE CGRA as a CFU and show the scalability of our solution. Finally, we show performance improvement of 3-140x in PE over commercially available Intel micro-architectures, ClearSpeed CSX700, FPGA, and Nvidia GPGPUs.
연구 동기 및 목표
- 다중코어 및 GPGPU 플랫폼에서 기존 BLAS 구현의 성능 포화 문제를 해결하기 위해, 이는 이론적 최고 성능의 15–57%에 그친다.
- 계산 및 메모리 자원 활용의 비효율성을 해결하기 위해, 계산 집약적 및 대역폭 제약이 있는 BLAS 커널에 대해 전통적인 아키텍처의 문제점을 해결한다.
- 마이크로아키텍처적 개선을 통해 BLAS 연산에 특화된 에너지 효율적인 처리 요소(PE)를 설계한다.
- 최적화된 PE를 REDEFINE CGRA에 맞춤형 기능 유닛(CFU)으로 통합하고, 행렬 크기의 변화에 따라 확장성과 성능을 평가한다.
제안 방법
- 레벨-1, -2, -3 BLAS 루틴을 효율적으로 실행하기 위해 마이크로아키텍처적 개선을 적용한 전용 처리 요소(PE)를 설계한다.
- REDEFINE 코arse-grained 재구성 가능한 아키텍처(CGRA)에 PE를 구현하여, 특정 계산 영역에 맞게 맞춤형 기능 유닛(CFU)을 커스터마이징할 수 있는 능력을 활용한다.
- BLAS 커널의 데이터 플로우를 모델링하고 병렬성을 식별하기 위해 방향성 비순환 그래프(DAG) 분석을 사용한다. 이를 통해 PE에 효율적으로 매핑할 수 있다.
- 큰 행렬을 블록(예: 10×10 또는 20×20)으로 분할하고, 타일화된 배열에 여러 PE에 걸쳐 계산을 분산시켜 병렬성을 활용한다.
- 타일 기반 알고리즘 접근법을 사용하여 계산과 통신의 균형을 맞추고, 데이터 이동 오버헤드를 최소화한다.
- 정확한 비교를 위해 CPI 및 Gflops/watt 지표를 사용하여 인텔, AMD, 네이버 GPU, FPGA, ClearSpeed CSX700 플랫폼과 PE 및 CGRA 구성의 성능을 벤치마크한다.
실험 결과
연구 질문
- RQ1알고리즘-아키텍처 공동 설계가 기존 다중코어 및 GPGPU 플랫폼에서 관찰된 BLAS 연산의 성능 포화 지점을 돌파할 수 있는가?
- RQ2맞춤형 PE의 마이크로아키텍처적 개선이 DGEMM, DGEMV, DDOT와 같은 BLAS 커널의 성능 및 에너지 효율성에 얼마나 기여하는가?
- RQ3REDEFINE CGRA에서 PE 기반 솔루션의 확장성은 행렬 크기와 타일 수가 증가함에 따라 어떻게 변화하는가?
- RQ4일반 프로세서 및 전용 가속기 대비 BLAS 워크로드에서 Gflops/watt 및 성능 향상 측면에서 기대할 수 있는 성능 향상은 어느 정도인가?
- RQ5도메인 특화 PE는 표준 프로세서 및 GPU보다 높은 성능을 달성하면서도 에너지 효율성을 유지할 수 있는가?
주요 결과
- 맞춤형 PE는 이중 정밀도 GEMM(DGEMM)에서 이론적 최고 성능의 74%, GEMV에서 40%, 내적(DDOT)에서 20%를 달성하여 일반 프로세서보다 뚜렷이 뛰어난 성능을 보였다.
- PE는 35.7 Gflops/watt의 성능을 달성하여, 인텔/AMD 프로세서(0.02–0.25 Gflops/watt) 및 네이버 GPU보다 뚜렷한 향상을 보였다.
- PE는 인텔 코어 마이크로아키텍처 대비 3–140×, 네이버 GPU 대비 7–139×, 알테라 FPGA 대비 10×, ClearSpeed CSX700 대비 3×의 Gflops/watt 기준 성능 향상을 달성했다.
- 2×2, 3×3, 4×4 타일 배열을 사용한 REDEFINE CGRA에서의 병렬 실현은 각각 단일 PE 구현 대비 최대 4×, 9×, 16×의 성능 향상을 이끌었으며, 더 큰 행렬 크기에서 성능 향상은 포화 상태에 도달했다.
- 행렬 크기가 증가함에 따라 계산 대 통신 비율이 향상되었으며(예: 20×20일 경우 10:1, 60×60일 경우 20:1), 더 큰 문제에서 통신 오버헤드가 감소함을 시사한다.
- 사용된 타일 수에 비례하는 일관된 성능 향상이 관찰되어 솔루션의 확장성이 검증되었으며, 공동 설계 접근법의 효과성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.