Skip to main content
QUICK REVIEW

[논문 리뷰] QPACE 2 and Domain Decomposition on the Intel Xeon Phi

Paul Arts, Jacques Bloch|arXiv (Cornell University)|2015. 02. 13.
Parallel Computing and Optimization Techniques참고 문헌 8인용 수 3
한 줄 요약

이 논문은 라티스 QCD 시뮬레이션을 위한 고성능 계산을 위해 설계된 인텔 Xeon Phi 프로세서 기반의 맞춤형 슈퍼컴퓨터인 QPACE 2를 제시한다. 도메인 분할 기반의 솔버를 구현하여 60개의 코어에서 거의 선형적인 강한 스케일링을 달성했으며, 비-DD 솔버에 비해 강한 스케일링에서 5배, 약한 스케일링에서 2–3배 빠른 시간-해결 속도를 확보하여 KNC 아키텍처에서 뛰어난 확장성과 효율성을 입증한다.

ABSTRACT

We give an overview of QPACE 2, which is a custom-designed supercomputer based on Intel Xeon Phi processors, developed in a collaboration of Regensburg University and Eurotech. We give some general recommendations for how to write high-performance code for the Xeon Phi and then discuss our implementation of a domain-decomposition-based solver and present a number of benchmarks.

연구 동기 및 목표

  • 라티스 QCD 시뮬레이션을 위한 비용과 에너지 효율적인 슈퍼컴퓨터인 QPACE 2를 설계하고 구현하기 위해 인텔 Xeon Phi(Knights Corner) 프로세서를 사용한다.
  • 대역폭에 제한되는 솔버의 한계를 극복하기 위해 지연에 대한 내성과 확장성이 뛰어난 도메인 분할(DD) 조건부 조건자(Preconditioner)를 구현한다.
  • 특히 메모리 액세스 패턴과 명령 수준의 병렬성에 중점을 두어 Xeon Phi 아키텍처에 최적화된 고성능 컴퓨팅 워크로드를 개선한다.
  • TACC Stampede 클러스터를 QPACE 2 전체 시스템의 대체 시스템으로 사용하여, 다중 노드 시스템에서 DD 솔버의 강한 및 약한 스케일링 행동을 평가한다.
  • 향후 Knights Landing Xeon Phi 아키텍처로 업그레이드된 QPACE 3의 기초를 마련한다.

제안 방법

  • QPACE 2는 네 개의 인텔 Xeon Phi 7120X 프로세서, 저전력 CPU, 듀얼 포트 FDR 인피니밴드 카드를 포함한 맞춤형 노드 설계를 사용하며, PCIe 스위치를 통해 피어 투 피어 통신을 가능하게 한다.
  • PCIe와 FDR 인피니밴드를 기반으로 한 이중 레이어 네트워크 토폴로지로 구성되어 있어 낮은 지연과 높은 대역폭을 통해 효율적인 노드 간 통신을 지원한다.
  • 특히 KNC의 메모리 계층에서의 성능을 향상시키기 위해 메모리 대역폭 압력을 줄이고 확장성을 향상시키기 위해 도메인 분할 기반의 솔버를 구현한다.
  • 최적화 기법으로는 L1 및 L2 소프트웨어 프리패칭, 명령 수준의 튜닝(예: 융합 곱셈-덧셈 사용), 60개의 KNC 코어에 걸친 균형 잡힌 로드 분배가 포함된다.
  • 성능 분석은 프로파일링을 위해 인텔 VTune를 사용하며, 다양한 격자 크기와 구성에서 Gflop/s/core 및 시간-해결 속도와 같은 핵심 메트릭을 측정한다.
  • 다중 노드 벤치마크는 QPACE 2 전체 시스템의 행동을 시뮬레이션하기 위해 7110P Xeon Phi 버전을 사용한 TACC Stampede 클러스터에서 수행된다.

실험 결과

연구 질문

  • RQ1Xeon Phi 아키텍처에서 도메인 분할 조건부 조건자와 비-DD 솔버의 강한 및 약한 스케일링 성능을 비교하면 어떻게 되는가?
  • RQ2Xeon Phi 7120X의 단일 코어 성능을 제한하는 주요 성능 저하 요인은 무엇이며, 소프트웨어 최적화로 이를 어떻게 완화할 수 있는가?
  • RQ3KNC의 메모리 계층과 캐시 동작이 라티스 QCD 솔버의 성능에 미치는 영향은 어느 정도인가?
  • RQ460개의 KNC 코어에 도메인을 분배할 때 로드 불균형은 다중 코어 스케일링에 어떤 영향을 미치며, 이를 최소화하기 위한 전략은 무엇인가?
  • RQ5실제 HMC 및 데이터 분석 워크로드에서 DD 솔버는 비-DD 솔버 대비 어느 정도의 성능 향상을 기대할 수 있는가?

주요 결과

  • 단일 코어 성능은 단일 정밀도에서 MR 반복의 경우 13.3 Gflop/s/core에 도달하며, 명령 수준의 오버헤드와 메모리 스토그가 성능 한계(22 Gflop/s/core)를 결정한다.
  • 전반적인 도메인 분할 조건부 조건자 성능은 9.5 Gflop/s/core를 기록하며, 주로 비-MR 구성 요소와 메모리 액세스 패턴으로 인한 성능 손실이 원인이다.
  • 도메인 수가 충분히 많을 경우 60개 코어에서 거의 선형적인 스케일링을 달성하지만, 도메인 수가 코어 수에 가까워질수록 로드 불균형이 심각해진다.
  • 강한 스케일링에서는 TACC Stampede 클러스터에서 1024노드(1024개의 KNC)까지 선형 스케일링을 유지하며, 비-DD 솔버 대비 5배의 성능 향상을 달성한다.
  • 약한 스케일링에서는 DD 솔버가 비-DD 솔버를 2–3배 뛰어넘으며, 대규모 데이터 분석에 적합함을 입증한다.
  • 시스템은 한 달간 연속 벤치마크를 수행하는 동안 안정적으로 작동하여 QPACE 2 아키텍처의 신뢰성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.