Skip to main content
QUICK REVIEW

[논문 리뷰] A performance evaluation of CCS QCD Benchmark on the COMA (Intel(R) Xeon Phi$^{TM}$, KNC) system

Taisuke Boku, Ken-Ichi Ishikawa|arXiv (Cornell University)|2016. 12. 20.
Particle physics theoretical and experimental studies참고 문헌 8인용 수 7
한 줄 요약

이 논문은 인텔 셰론 필(코어) 프로세서를 탑재한 COMA 시스템에서 CCS QCD 벤치마크의 성능을 평가하며, 역방향 오프로딩과 SCIF 통신을 사용한 겹쳐진 제한된加법적 Schwarz 조절자를 활용해 단정밀도 BiCGStab 해법기를 최적화한다. $24^3 \times 96$ 격자에서 윌슨-클로버 이동 행렬 곱셈에 대해 약 190 GFlops의 지속 성능을 달성하며, 효율적인 통신-계산 겹침과 $24^3 \times 32$ 이상의 격자 크기를 초과한 강한 약한 스케일링을 입증한다.

ABSTRACT

The most computationally demanding part of Lattice QCD simulations is solving quark propagators. Quark propagators are typically obtained with a linear equation solver utilizing HPC machines. The CCS QCD Benchmark is a benchmark program solving the Wilson-Clover quark propagator, and is developed at the Center for Computational Sciences (CCS), University of Tsukuba. We optimized the benchmark program for a \Intel \XeonPhi (Knights Corner, KNC) system named "COMA (PACS-IX)" at CCS Tsukuba under the Intel Parallel Computing Center program. A single precision BiCGStab solver with the overlapped Restricted Additive Schwarz (RAS) preconditioner was implemented using SIMD intrinsics, OpenMP and MPI in the offload mode. With the reverse-offloading technique, we could reduce the communication and offloading overheads. We observed a performance of $\sim 200$ GFlops sustained for the Wilson-Clover hopping matrix multiplication on the lattice sizes larger than $24^3 imes 32$ on a sinlge card of the COMA system. A good weak scaling perofmace was observed on the local lattice sizes larger than $24^3 imes 32$.

연구 동기 및 목표

  • COMA 시스템에 탑재된 인텔 셰론 필(코어) 공처리기와 함께 CCS QCD 벤치마크의 성능 평가 및 최적화를 위한 목표.
  • 호스트 프oxy 서버를 활용한 역방향 오프로딩을 통해 오프로딩 모드에서의 통신 및 오프로딩 오버헤드를 줄이기 위한 목표.
  • SIMD, OpenMP, MPI를 활용한 단정밀도 윌슨-클로버 쿼크 행렬 곱셈에서 높은 지속 성능 달성 목표.
  • 이동 행렬 곱셈 커널에서 작업 분리 기반으로 통신-계산 겹침을 가능하게 하기 위한 목표.
  • 큰 국부적 격자 크기(>$24^3 \times 32$)에서 강한 약한 스케일링 행동을 입증하기 위한 목표.

제안 방법

  • 오프로딩 모드에서 SIMD 인트린식, OpenMP, MPI를 활용해 겹쳐진 제한된 가감성 슈바르츠(RAS) 조절자를 갖춘 단정밀도 BiCGStab 해법기를 구현.
  • 대칭 통신 인터페이스(SCIF)를 통해 호스트 CPU 프록시에 MPI 통신 요청을 오프로딩하여 오프로딩 오버헤드를 최소화하기 위해 역방향 오프로딩을 적용.
  • 이동 행렬 곱셈을 세 단계로 분할: 전처리(MULT_PRE), 내부 점 계산(MULT_IN), 표면 점 계산(MULT_PST)으로 조건부 분기 제거.
  • 비차단 SCIF 호출을 사용해 통신-계산 겹침을 가능하게 하여 통신 지연을 계산 뒤에 숨김.
  • 계산 커널에 표준 KNC 최적화 기법(예: 프리패칭, 스레딩, 벡터화)을 적용.
  • 다양한 국부적 격자 크기와 병렬 분할에 따른 성능 측정을 통해 약한 스케일링 평가.

실험 결과

연구 질문

  • RQ1역방향 오프로딩과 SCIF 기반 통신은 인텔 셰론 필(코어) 시스템에서 MPI 기반 HPC 응용 프로그램의 오프로딩 오버헤드를 줄일 수 있는가?
  • RQ2최적화된 커널을 사용해 COMA 시스템에서 단정밀도 윌슨-클로버 이동 행렬 곱셈에서 달성 가능한 성능는 얼마인가?
  • RQ3작업 분리와 비차단 통신을 통해 BiCGStab 해법기에서 통신-계산 겹침을 얼마나 효과적으로 달성할 수 있는가?
  • RQ4COMA 시스템에서 국부적 격자 크기와 병렬 분할 증가에 따라 약한 스케일링 성능는 어떻게 변화하는가?
  • RQ5해법기에서 통신 지연을 효과적으로 숨기기 위해 필요한 최소 국부적 격자 크기는 얼마인가?

주요 결과

  • 최적화된 단정밀도 BiCGStab 해법기는 $24^3 \times 32$ 이상의 격자 크기에서 단일 KNC 카드에서 약 200 GFlops의 지속 성능 달성.
  • 국부적 격자 크기가 $24^3 \times 96$일 때 윌슨-클로버 이동 행렬 곱셈에서 약 190 GFlops의 지속 성능 달성.
  • 국부적 격자 크기 $N_S \geq 24$일 경우에 통신 숨김이 효과적이었으며, 약한 스케일링 테스트에서 채워진 원과 열린 원 기호 간 격차가 감소함.
  • 3차원 병렬 분할에서 양호한 약한 스케일링 관찰, 프로세스 수 증가에 따라 성능 안정성 유지.
  • 역방향 오프로딩 기법은 오프로딩 오버헤드를 성공적으로 감소시키고 SCIF를 통한 비차단 통신을 가능하게 함.
  • 성능 향상은 MULT 커널에서의 작업 분리에 의한 통신-계산 겹침의 효과적인 구현 덕분으로 기인됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.