[논문 리뷰] Extreme Scale-out SuperMUC Phase 2 - lessons learned
이 논문은 86,016개의 코어를 가진 2.81 PetaFLOP 슈퍼컴퓨터인 SuperMUC Phase 2에서 진행된 28일간의 극한 수평 확장 워크숍에서 얻은 교훈을 제시한다. 연구는 14개의 HPC 애플리케이션에 대해 MPI 및 하이브리드 OpenMP/MPI 스케일링을 평가하여, 하이브리드 모델이 스케일링 시 성능 향상을 이끌어내지만, MPI 오버헤드와 메모리 제한이 페타스케일 워크로드에서 응용 프로그램 수준의 튜닝과 I/O 전략 계획이 필요로 하는 핵심 병목 현상임을 밝혀냈다.
In spring 2015, the Leibniz Supercomputing Centre (Leibniz-Rechenzentrum, LRZ), installed their new Peta-Scale System SuperMUC Phase2. Selected users were invited for a 28 day extreme scale-out block operation during which they were allowed to use the full system for their applications. The following projects participated in the extreme scale-out workshop: BQCD (Quantum Physics), SeisSol (Geophysics, Seismics), GPI-2/GASPI (Toolkit for HPC), Seven-League Hydro (Astrophysics), ILBDC (Lattice Boltzmann CFD), Iphigenie (Molecular Dynamic), FLASH (Astrophysics), GADGET (Cosmological Dynamics), PSC (Plasma Physics), waLBerla (Lattice Boltzmann CFD), Musubi (Lattice Boltzmann CFD), Vertex3D (Stellar Astrophysics), CIAO (Combustion CFD), and LS1-Mardyn (Material Science). The projects were allowed to use the machine exclusively during the 28 day period, which corresponds to a total of 63.4 million core-hours, of which 43.8 million core-hours were used by the applications, resulting in a utilization of 69%. The top 3 users were using 15.2, 6.4, and 4.7 million core-hours, respectively.
연구 동기 및 목표
- 새로운 86,016코어 페타스케일 시스템에서 다양한 HPC 애플리케이션의 성능과 확장성 평가.
- 특히 MPI 오버헤드와 메모리 사용과 관련된 극한 규모 HPC 워크로드에서의 시스템 수준 및 응용 프로그램 수준의 과제 규명.
- 하이브리드 OpenMP/MPI 프로그래밍 모델이 확장성 향상과 통신 비용 감소에 얼마나 효과적인지 평가.
- 대규모 슈퍼컴퓨팅 캠프에서 I/O 전략, 체크포인팅, 시스템 준비 작업에 대한 최선의 실천 방안 개발.
- 워크숍 단계 동안 유일한 시스템 전용 작업 스케줄링을 통해 하드웨어 및 소프트웨어 버그를 탐지하고 해결.
제안 방법
- 86,016개의 코어, 194TB 메모리, 15PB GPFS 스토리지로 구성된 전체 SuperMUC Phase 2 시스템을 단일 애플리케이션에서 독점적으로 사용할 수 있도록 28일간의 극한 수평 확장 워크숍을 실시.
- MPI, OpenMP 또는 하이브리드 모델을 사용한 14개의 다양한 HPC 애플리케이션에 대해 전력 소비, 작업 실행 시간, 확장성 행동을 측정.
- FLASH, BQCD, CIAO 등의 주요 코드에 대해 강한 스케일링과 약한 스케일링을 평가하였으며, 격자 크기와 코어 수를 최대 86,016까지 증가시킴.
- 특히 스케일링 시에 중요한 성능 병목 현상으로서 MPI 스택 메모리 사용량과 시작 시간을 분석.
- 노드 수준 성능 최적화와 통신 오버헤드 감소를 위해 각 MPI 작업당 7, 14, 또는 28개의 OpenMP 스레드를 사용한 하이브리드 모델 테스트.
- MPI 인덱스 값의 Integer*4 제한으로 인한 버퍼 오버플로우 문제를 확인하고, 내부 MPI 제약을 극복하기 위해 응용 프로그램 수준의 버퍼링을 제안.
실험 결과
연구 질문
- RQ186,016개의 코어를 가진 2.81 PetaFLOP 시스템에서 다양한 MPI 및 하이브리드 OpenMP/MPI 구성이 애플리케이션 확장성에 어떻게 영향을 미치는가?
- RQ2대규모 HPC 워크로드에서 주로 나타나는 성능 병목 현상은 무엇이며, 특히 MPI 스택 메모리와 시작 시간과 관련된가?
- RQ3전력 소비는 작업 크기와 어떻게 스케일링되는가? 에너지 효율성과 인프라 계획에 어떤 영향을 미치는가?
- RQ4하이브리드 프로그래밍 모델이 극한 규모 시스템에서 성능 향상과 통신 오버헤드 감소에 얼마나 기여하는가?
- RQ5새로운 페타스케일 슈퍼컴퓨터에 성공적으로 배포하기 위해 필수적인 시스템 및 응용 프로그램 수준의 준비 전략은 무엇인가?
주요 결과
- 28일 동안 시스템의 활용도는 69%였으며, 응용 프로그램에 의해 총 4380만 코어시간이 사용되었고, 상위 3개 사용자가 각각 1520만, 640만, 470만 코어시간을 소비했다.
- 전력 소비는 작업 크기와 거의 선형적으로 증가하였으며, 가장 큰 작업에서는 1.2MW 이상에 도달했고, ILBDC와 같은 메모리 집약형 코드보다 SeisSol이 훨씬 더 많은 에너지를 소비했다.
- BQCD 공액 그래디언트 해법기에서 하이브리드 모델(각 MPI 작업당 7개의 OpenMP 스레드)이 전체 시스템에서 순수 MPI보다 우수한 성능을 보였으며, 86,016개의 코어에서 최고 성능을 기록했다.
- MPI 시작 시간과 스택 메모리 사용량이 특히 큰 작업에서 중요한 성능 병목 현상이 되었으며, 스택 메모리가 노드 메모리의 비현저한 비율을 차지했다.
- MPI 인덱스 값의 Integer*4 제한으로 인해 버퍼 오버플로우 문제가 발생했고, 이는 응용 프로그램 수준의 내부 버퍼링을 통해 해결되었다.
- 극한 수평 확장 모드 덕분에 일반적인 공유 운영 환경에서는 거의 고립이 불가능한 희귀하고 복잡한 하드웨어 버그(예: 동시 타임아웃과 하드웨어 고장의 조합)를 탐지할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.