Skip to main content
QUICK REVIEW

[논문 리뷰] Porting a sparse linear algebra math library to Intel GPUs

Yu‐Hsiang Tsai, Terry Cojean|arXiv (Cornell University)|2021. 03. 18.
Parallel Computing and Optimization Techniques참고 문헌 12인용 수 6
한 줄 요약

이 논문은 DPC++ 및 oneAPI를 사용하여 Intel GPU용으로 최초의 오픈소스이며 플랫폼 이식 가능한 희소 선형 대수 라이브러리 백엔드를 제시하며, 벤더 최적화 라이브러리와 경쟁 가능한 성능을 보여준다. 이는 Intel Gen12 GPU에서 최대 90%의 피크 대역폭을 달성하며, AMD, NVIDIA, Intel 하드웨어 간에 뛰어난 성능 이식성을 보이며, DPC++가 신개념 Intel GPU에서 HPC 워크로드에 실현 가능한 길임을 입증한다.

ABSTRACT

With the announcement that the Aurora Supercomputer will be composed of general purpose Intel CPUs complemented by discrete high performance Intel GPUs, and the deployment of the oneAPI ecosystem, Intel has committed to enter the arena of discrete high performance GPUs. A central requirement for the scientific computing community is the availability of production-ready software stacks and a glimpse of the performance they can expect to see on Intel high performance GPUs. In this paper, we present the first platform-portable open source math library supporting Intel GPUs via the DPC++ programming environment. We also benchmark some of the developed sparse linear algebra functionality on different Intel GPUs to assess the efficiency of the DPC++ programming ecosystem to translate raw performance into application performance. Aside from quantifying the efficiency within the hardware-specific roofline model, we also compare against routines providing the same functionality that ship with Intel's oneMKL vendor library.

연구 동기 및 목표

  • oneAPI 생태계를 활용하여 Intel의 신제품 디스크리트 GPU에서 생산 수준의 희소 선형 대수 기능을 가능하게 하기 위해.
  • Intel Gen9 및 Gen12 GPU에서 DPC++ 기반 커널의 성능을 하드웨어 한계 및 벤더 라이브러리와 비교 평가하기 위해.
  • 단일 DPC++ 백엔드를 사용하여 다양한 GPU 아키텍처 간에 Ginkgo 라이브러리의 플랫폼 이식성을 입증하기 위해.
  • 원시 GPU 성능이 실제 희소 선형 대수 연산(예: SpMV 및 Krylov 솔버)으로 얼마나 효율적으로 변환되는지 평가하기 위해.

제안 방법

  • oneAPI 프로그래밍 모델을 통해 Intel GPU를 지원하기 위해 Ginkgo 오픈소스 라이브러리에 DPC++ 백엔드를 확장하였다.
  • Intel GPU에서 단일 정밀도 및 이중 정밀도 모두에 대해 최적화된 희소 행렬-벡터 곱(SpMV) 커널을 DPC++로 구현하였다.
  • Intel Gen9 및 Gen12 GPU에서 SuiteSparse 컬렉션의 행렬을 사용하여 SpMV 및 Krylov 솔버를 벤치마킹하였다.
  • Intel의 oneMKL 벤더 라이브러리와의 성능 비교를 수행하고, 하드웨어 특화 루프라인 모델을 활용해 효율성을 평가하였다.
  • 각 플랫폼 간의 이식성과 알고리즘 효율성을 평가하기 위해 이론적 피크 성능(대역폭 및 FLOP/s) 대비 상대적 성능을 사용하였다.
  • Ginkgo의 모듈러 설계를 활용하여 실행자, 타입, 바인딩 등의 핵심 컴포넌트를 재사용하면서 DPC++ 런타임 의미 체계에 맞게 적응시켰다.

실험 결과

연구 질문

  • RQ1DPC++를 사용하여 플랫폼 이식 가능한 오픈소스 희소 선형 대수 라이브러리가 Intel의 신제품 디스크리트 GPU에서 높은 성능을 달성할 수 있는가?
  • RQ2DPC++ 기반 SpMV 커널의 성능은 Intel GPU에서 Intel의 oneMKL 벤더 라이브러리와 비교해 어떻게 되는가?
  • RQ3Ginkgo 라이브러리가 AMD, NVIDIA, Intel GPU 아키텍처 간에 얼마나 높은 성능 이식성을 유지하는가?
  • RQ4Intel Gen12 GPU에서 Krylov 솔버의 성능은 어느 정도 달성될 수 있으며, 그 효율성에 영향을 주는 제약 요소는 무엇인가?
  • RQ5DPC++ 프로그래밍 모델은 원시 하드웨어 성능을 희소 선형 대수 애플리케이션 수준의 성능으로 얼마나 잘 변환하는가?

주요 결과

  • Ginkgo용 DPC++ 백엔드는 Intel Gen12 GPU에서 최대 피크 메모리 대역폭의 90%를 달성하여 커널 최적화의 높은 효율성을 보여준다.
  • Intel Gen12 GPU에서 Ginkgo의 SpMV 커널은 단일 정밀도로 5–9 GFLOP/s를 기록하며, 행렬의 구조에 따라 성능이 크게 달라진다.
  • GMRES 솔버는 다른 Krylov 솔버보다 낮은 성능을 보였는데, 이는 Hessenberg 시스템 해법과 같은 필수 연산에 대한 oneAPI 지원이 완전하지 않기 때문일 것이다.
  • Intel Gen9 GPU에서는 이중 정밀도에서 SpMV 성능이 1.5–2.5 GFLOP/s에 이르며, Ginkgo 커널은 피크 대역폭의 60–70%를 달성한다.
  • Ginkgo의 SpMV 커널은 모든 플랫폼에서 oneMKL과 경쟁 가능했으며, 일부 Gen12 케이스에서는 oneMKL이 더 빠르고, 다른 경우에서는 Ginkgo가 더 빠른 성능을 보였다.
  • 상대적 성능 분석을 통해 강력한 성능 이식성이 확인되었으며, Ginkgo의 DPC++ 백엔드는 AMD, NVIDIA, Intel GPU 간에 일관된 효율성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.