Skip to main content
QUICK REVIEW

[논문 리뷰] ECM modeling and performance tuning of SpMV and Lattice QCD on A64FX

Christie Louis Alappat, Nils Meyer|arXiv (Cornell University)|2021. 03. 04.
Parallel Computing and Optimization Techniques참고 문헌 14인용 수 8
한 줄 요약

이 논문은 A64FX 프로세서에서 희소 행렬-벡터 곱셈(SpMV)과 격자 QCD 도메인 월 커널을 분석하고 최적화하기 위해 실행-캐시-메모리(ECM) 성능 모델을 제안한다. 아키텍처적 통찰력과 컴파일러 최적화를 활용하여, 저자들은 SpMV에서 SELL-C-σ 형식이 메모리 대역폭 포화를 달성함을 입증하였고, 최적화된 데이터 레이아웃은 QCD 커널에서 캐시 재사용과 에너지 효율성을 향상시켜 A64FX가 Intel Cascade Lake AP를 2배 뛰어나고, NVIDIA V100 성능을 메모리 기반 워크로드에서 따라잡을 수 있도록 한다.

ABSTRACT

The A64FX CPU is arguably the most powerful Arm-based processor design to date. Although it is a traditional cache-based multicore processor, its peak performance and memory bandwidth rival accelerator devices. A good understanding of its performance features is of paramount importance for developers who wish to leverage its full potential. We present an architectural analysis of the A64FX used in the Fujitsu FX1000 supercomputer at a level of detail that allows for the construction of Execution-Cache-Memory (ECM) performance models for steady-state loops. In the process we identify architectural peculiarities that point to viable generic optimization strategies. After validating the model using simple streaming loops we apply the insight gained to sparse matrix-vector multiplication (SpMV) and the domain wall (DW) kernel from quantum chromodynamics (QCD). For SpMV we show why the CRS matrix storage format is not a good practical choice on this architecture and how the SELL-C-sigma format can achieve bandwidth saturation. For the DW kernel we provide a cache-reuse analysis and show how an appropriate choice of data layout for complex arrays can realize memory-bandwidth saturation in this case as well. A comparison with state-of-the-art high-end Intel Cascade Lake AP and Nvidia V100 systems puts the capabilities of the A64FX into perspective. We also explore the potential for power optimizations using the tuning knobs provided by the Fugaku system, achieving energy savings of about 31% for SpMV and 18% for DW.

연구 동기 및 목표

  • HPC 워크로드를 위한 고대역폭 Arm 기반 프로세서인 A64FX CPU의 성능 특성을 이해하기 위해.
  • A64FX의 캐시 계층, 메모리 대역폭, 전력 관리 기능에서의 아키텍처적 특이성과 최적화 기회를 규명하기 위해.
  • A64FX에서 단일 코어 안정 상태 루프에 대한 실행-캐시-메모리(ECM) 성능 모델을 개발하고 검증하기 위해.
  • 데이터 레이아웃과 컴파일러 최적화에 중점을 두고 ECM 모델링을 통해 SpMV와 격자 QCD 도메인 월 커널을 최적화하기 위해.
  • 메모리 기반 HPC 워크로드에서 최신 기술인 Intel Cascade Lake AP와 NVIDIA V100 시스템과의 성능 및 에너지 효율성 비교를 위해.

제안 방법

  • A64FX에서 단일 코어 성능 기여도를 분석하기 위해 실행-캐시-메모리(ECM) 성능 모델을 개발하였다.
  • SVE 벡터 유닛, 순서 없는 실행, 섹터 캐시, 하드웨어 장벽 기능을 포함한 A64FX의 세부 아키텍처 분석을 수행하였다.
  • 메모리 대역폭과 캐시 동작 예측 정확도를 확보하기 위해 스트리밍 커널을 사용하여 ECM 모델을 검증하였다.
  • SpMV에 ECM 모델을 적용하여 CRS 대비 SELL-C-σ 행렬 형식을 평가하고, SELL-C-σ에서 대역폭 포화를 확인하였다.
  • 캐시 재사용 모델링을 통해 격자 QCD 도메인 월 커널을 분석하고, 포트 압력을 줄이기 위해 데이터 레이아웃(예: 분할 RRII)을 테스트하였다.
  • 컴파일러 및 데이터 레이아웃 최적화를 활용하여 Fugaku 시스템의 전력 조절 장치를 탐색하여 성능 손실 없이 에너지 절감을 달성하였다.

실험 결과

연구 질문

  • RQ1A64FX의 메모리 계층과 고대역폭(800+ GB/s)은 SpMV 및 격자 QCD와 같은 메모리 기반 커널의 성능에 어떻게 영향을 미치는가?
  • RQ2왜 표준 CRS 형식은 A64FX에서 SpMV에 비효율적인가? 어떤 데이터 형식(예: SELL-C-σ)이 메모리 대역폭 포화를 가능하게 하는가?
  • RQ3데이터 레이아웃 선택은 격자 QCD 도메인 월 커널에서 캐시 재사용과 메모리 포트 압력에 어떻게 영향을 미치는가?
  • RQ4Fugaku 시스템의 전력 조절 장치를 통해 얼마나 많은 에너지 소비를 줄일 수 있으며, 성능 손실 없이 가능한가?
  • RQ5메모리 기반 HPC 워크로드에서 A64FX는 Intel Cascade Lake AP와 NVIDIA V100에 비해 성능 및 에너지 효율성 면에서 어떻게 비교되는가?

주요 결과

  • SELL-C-σ 행렬 형식은 A64FX에서 SpMV에서 메모리 대역폭 포화를 달성하며, 더 나은 데이터 접근 패턴 덕분에 표준 CRS 형식보다 뛰어난 성능을 발휘한다.
  • 대규모 메모리 기반 SpMV 데이터셋에 대해 A64FX는 Intel Cascade Lake AP 대비 2배 빠른 성능 향상을 보였고, NVIDIA V100 성능을 따라잡는 데 성공했다.
  • 격자 QCD 도메인 월 커널의 복소수 배열에 대해 분할 RRII 데이터 레이아웃을 적용함으로써 포트 압력을 줄이고 에너지 효율성을 약 20% 향상시켰다.
  • 컴파일러 최적화 품질은 A64FX에 대해 열악하다. GCC와 FCC 모두 효율적인 코드를 생성하지 못하여, 맞춤형 최적화의 필요성을 드러냈다.
  • 시스템 장치를 통한 전력 조절을 통해 SpMV에 대해 에너지 소비를 31% 절감하고 도메인 월 커널에 대해 18% 절감하였으며, 성능 영향은 최소한이었다.
  • ECM 모델은 A64FX에서 메모리 기반 및 계산 기반 커널에 대한 성능 저하 요인을 성공적으로 식별하고 효과적인 최적화 전략을 안내하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.