[논문 리뷰] Towards Exascale for Wind Energy Simulations
이 논문은 대기권 경계층(ABL) 유동에 관한 풍력 에너지 응용 분야에서의 초계급 시스템 준비성에 대해 개방 소스 CFD 코드인 NekRS(고차수 스펙트럴 요소)와 AMR-Wind(블록 구조적 유한체적 방법 및 AMR를 갖춘)의 대규모 난류 시뮬레이션(LES)에 대해 평가한다. Summit과 Crusher 슈퍼컴퓨터를 사용하여 최대 4,800개의 GPU에서 강한 스케일링과 약한 스케일링을 구현하였으며, 문제 크기에 관계없이 AMR-Wind가 NekRS 대비 1.4–2.0배의 성능을 기록하였다. 압력 푸아송 해법이 두 코드 모두에서 강한 스케일링을 제한하는 주요 통신 집약적 블로킹 요소로 규명되었다.
We examine large-eddy-simulation modeling approaches and computational performance of two open-source computational fluid dynamics codes for the simulation of atmospheric boundary layer (ABL) flows that are of direct relevance to wind energy production. The first is NekRS, a high-order, unstructured-grid, spectral element code. The second, AMR-Wind, is a block-structured, second-order finite-volume code with adaptive-mesh-refinement capabilities. The objective of this study is to co-develop these codes in order to improve model fidelity and performance for each. These features will be critical for running ABL-based applications such as wind farm analysis on advanced computing architectures. To this end, we investigate the performance of NekRS and AMR-Wind on the Oak Ridge Leadership Facility supercomputers Summit, using 4 to 800 nodes (24 to 4,800 NVIDIA V100 GPUs), and Crusher, the testbed for the Frontier exascale system using 18 to 384 Graphics Compute Dies on AMD MI250X GPUs. We compare strong- and weak-scaling capabilities, linear solver performance, and time to solution. We also identify leading inhibitors to parallel scaling.
연구 동기 및 목표
- 현대의 GPU 가속 HPC 시스템에서 ABL 유동 시뮬레이션을 위한 NekRS와 AMR-Wind의 확장성 및 성능 평가.
- 초계급 아키텍처에서의 코드 효율성과 정확도 향상으로 고해상도 LES를 통한 풍력단지 및 지역 기상 모델링 지원.
- 병렬 스케일링에서의 성능 블로킹 요소 규명, 특히 선형 해법기 및 통신 집약적 커널에서의 영향 분석.
- 두 코드의 공동 개발을 통해 초계급 배포를 위한 모델 정확도 및 계산 효율성 향상.
- 초계급 준비성을 입증하기 위해 Summit 및 Crusher 시스템을 활용해 최대 4,800개의 GPU에서 강한 스케일링과 약한 스케일링 성능 입증.
제안 방법
- 오크 리더십 시설의 시스템에서 NekRS와 AMR-Wind를 사용해 GABLS 기준 문제의 대규모 난류 시뮬레이션 수행.
- 비정렬 메esh를 갖춘 고차수 스펙트럴 요소 코드인 NekRS와 적응 메쉬 분해 기능을 갖춘 블록 구조적 2차 유한체적 코드인 AMR-Wind 사용.
- Summit에서 4–800노드(24–4,800개의 V100 GPU) 및 Crusher에서 18–384개의 그래픽스 컴퓨팅 다이(이상의 MI250X GPU)에서 강한 스케일링과 약한 스케일링 성능 측정.
- 비선형 운동량 이송 항 및 압력 푸아송 해법을 포함한 주요 계산 커널 프로파일링을 통해 스케일링 블로킹 요소 규명.
- 호스트 CPU에서의 군집 해법을 위해 대수적 다중 격자(hypre) 사용 및 실제 시간, 반복 횟수, 실제 시간 대 벽면 시간 비율 분석.
- 다양한 문제 크기와 프로세서 수에서의 성능 비교를 통해, 특히 AMR-Wind의 블록 구조적 분할 방식에 기인한 2의 거듭제곱 프로세서 수의 영향에 중점을 둠.
실험 결과
연구 질문
- RQ1Summit과 Crusher와 같은 GPU 가속 초계급 아키텍처에서 NekRS와 AMR-Wind는 어떻게 스케일링되는가?
- RQ2현대 HPC 아키텍처에서 대기권 경계층 유동의 대규모 난류 시뮬레이션에서 주요 성능 블로킹 요소는 무엇인가?
- RQ3선형 해법기 조건부에 따라 LES 시뮬레이션의 수렴성과 스케일링에 어떤 영향을 미치는가?
- RQ4AMR-Wind의 성능은 블록 구조적 설계에 기인해 2의 거듭제곱인 프로세서 수에 얼마나 의존하는가?
- RQ5초계급 시스템에서 기상 및 풍력 에너지 모델링에서 실제 시간 대 벽면 시간 비율(rt)을 1 이하로 유지할 수 있는가?
주요 결과
- NekRS는 GPU당 200만 개의 점을 가진 n/P = 200만에서 80%의 병렬 효율성을 기록하며 물리적 1초당 벽면 시간 0.11초를 달성하였다.
- 모든 테스트 문제 크기 및 GPU 수에서 AMR-Wind는 NekRS 대비 1.4–2.0배 이내의 성능를 기록하였다.
- 압력 푸아송 해법이 두 코드 모두에서 강한 스케일링을 제한하는 주요 통신 집약적 블로킹 요소로 규명되었다.
- AMR-Wind는 GPU 수가 2의 거듭제곱일 경우, 유리한 블록 분할 덕분에 병렬 효율성이 최대 36% 향상되는 뚜렷한 성능 향상을 보였다.
- NekRS의 경우, 단일 AMD MI250X 그래픽스 컴퓨팅 다이가 Summit의 단일 NVIDIA V100 GPU와 유사한 성능를 보였다.
- 고정 도메인 크기에서 선형 해상도가 두 배로 증가함에 따라 실제 시간 대 벽면 시간 비율(rt)이 두 배로 증가하였으며, 이는 고정 도메인 크기에서 시간단계 수의 증가가 필요하기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.