Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating the Performance of NVIDIA's A100 Ampere GPU for Sparse Linear Algebra Computations

Yu‐Hsiang Tsai, Terry Cojean|arXiv (Cornell University)|2020. 08. 19.
Parallel Computing and Optimization Techniques참고 문헌 19인용 수 7
한 줄 요약

이 논문은 메모리 유량과 SpMV 커널, 그리고 Krylov 솔버 반복을 중심으로 NVIDIA의 A100 Ampere GPU의 희소 선형 대수 연산 성능을 평가한다. A100은 V100 대비 최대 1.7배 높은 메모리 유량을 달성했으며, 개선된 메모리 액세스 방식과 더 큰 캐시 덕분에 Krylov 솔버가 1.8배 이상 빠르게 실행되어, 메모리에 종속되는 과학 계산 워크로드에서 뚜렷한 성능 향상을 보여준다.

ABSTRACT

GPU accelerators have become an important backbone for scientific high performance computing, and the performance advances obtained from adopting new GPU hardware are significant. In this paper we take a first look at NVIDIA's newest server line GPU, the A100 architecture part of the Ampere generation. Specifically, we assess its performance for sparse linear algebra operations that form the backbone of many scientific applications and assess the performance improvements over its predecessor.

연구 동기 및 목표

  • 희소 선형 대수 연산이 과학 고성능 컴퓨팅에 핵심적인데, NVIDIA A100 GPU의 성능를 평가하는 것.
  • Babel-STREAM 벤치마크를 사용해 이전 V100 GPU 대비 메모리 유량 향상을 평가하는 것.
  • Suite Sparse Matrix Collection 소속 2,800개 행렬을 활용해 cuSPARSE 및 Ginkgo 라이브러리를 통해 SpMV 커널 성능을 분석하는 것.
  • A100에서 SpMV, 벡터 연산, 직교화를 포함한 Krylov 솔버의 종단 간 성능을 측정하는 것.
  • 더 큰 캐시와 같은 아키텍처적 향상 덕분에 순수한 유량 향상 외에도 성능 향상이 이루어지는지 판단하는 것.

제안 방법

  • 8.2 GB까지의 배열 크기를 갖는 A100과 V100 GPU에서 Babel-STREAM 프레임워크를 사용해 메모리 유량을 벤치마크했다.
  • NVIDIA의 cuSPARSE와 오픈소스인 Ginkgo 라이브러리를 사용해 Suite Sparse Matrix Collection 소속 2,800개의 희소 행렬에 대해 SpMV 성능을 평가했다.
  • Krylov 솔버 통합 및 성능 측정의 기준으로 Ginkgo의 COO 형식 SpMV 커널을 사용했다.
  • CG, BiCG, GMRES 등의 예제를 포함한 전체 Krylov 솔버 반복 시간과 V100 대비 속도 향상을 측정했다.
  • SpMV 및 벡터 연산 성능 비율을 분석해, 메모리 유량 향상 외에 캐시 향상의 기여도를 분리해내는 것.
  • 관측된 속도 향상과 이론적 유량 향상 간 비교를 통해 순수한 메모리 대역폭 외 아키텍처적 이점이 존재하는지 평가하는 것.

실험 결과

연구 질문

  • RQ1대규모 스트리밍 메모리 액세스 패턴에서 A100 GPU의 메모리 유량은 V100 GPU 대비 어떻게 비교되는가?
  • RQ2다양한 희소 행렬에서 cuSPARSE 및 Ginkgo의 SpMV 커널이 A100에서 V100 대비 얼마나 향상되는가?
  • RQ3A100에서 완전한 Krylov 솔버 반복의 총 속도 향상은 V100 대비 얼마나 되며, 다양한 Krylov 방법에 따라 어떻게 달라지는가?
  • RQ4더 큰 캐시 덕분에 A100이 1.7배 메모리 유량 향상 외에도 측정 가능한 성능 향상을 제공하는가?
  • RQ5SpMV 및 벡터 연산의 성능 향상이 실제 과학 워크로드에서 전체 솔버 실행 시간에 어떻게 영향을 주는가?

주요 결과

  • A100 GPU는 대규모 배열에서 최대 1.4 TB/s의 메모리 유량을 달성했으며, 이는 V100 GPU의 840 GB/s 대비 1.7배 향상된 것이다.
  • SpMV 커널의 경우, A100은 1.7배 유량 향상 이상의 성능 향상을 달성했으며, 특히 향상된 메모리 액세스 패턴과 더 큰 캐시 덕분에 유리하다.
  • Ginkgo의 Krylov 반복 솔버는 다양한 10개의 큰 실세계 행렬에서 A100 GPU에서 V100 GPU 대비 1.8배 이상 더 빠르게 실행된다.
  • 짧은 재귀 Krylov 방법(CG, BiCG)의 경우 속도 향상은 거의 동일하며 항상 1.8배 이상이었으며, 이는 SpMV 성능 향상과 강력한 스케일링을 보여준다.
  • 직교화에 더 많은 의존도를 가진 GMRES는 다른 속도 향상 프로파일을 보였지만 여전히 1.7배 이상의 속도 향상을 보였으며, 이는 캐시 및 메모리 최적화가 계산 집약적인 단계에도 유리함을 시사한다.
  • 성능 향상은 순수한 메모리 유량 덕분만은 아니며, 더 큰 캐시와 향상된 메모리 계층 구조와 같은 아키텍처적 특징이 SpMV 및 직교화 커널 성능 향상에 크게 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.