[论文解读] Towards Exascale for Wind Energy Simulations
本文评估了两种开源CFD代码——NekRS(高阶谱元法)和AMR-Wind(带AMR的块结构有限体积法)——在大型涡模拟(LES)大气边界层(ABL)流动中的百亿亿次计算准备度,相关研究针对风能应用。利用Summit和Crusher超级计算机,研究展示了在4,800块GPU上实现的强缩放与弱缩放性能,表明AMR-Wind在所有问题规模下性能均达到NekRS的1.4–2.0倍,且压力泊松求解被识别为主要的缩放瓶颈。
We examine large-eddy-simulation modeling approaches and computational performance of two open-source computational fluid dynamics codes for the simulation of atmospheric boundary layer (ABL) flows that are of direct relevance to wind energy production. The first is NekRS, a high-order, unstructured-grid, spectral element code. The second, AMR-Wind, is a block-structured, second-order finite-volume code with adaptive-mesh-refinement capabilities. The objective of this study is to co-develop these codes in order to improve model fidelity and performance for each. These features will be critical for running ABL-based applications such as wind farm analysis on advanced computing architectures. To this end, we investigate the performance of NekRS and AMR-Wind on the Oak Ridge Leadership Facility supercomputers Summit, using 4 to 800 nodes (24 to 4,800 NVIDIA V100 GPUs), and Crusher, the testbed for the Frontier exascale system using 18 to 384 Graphics Compute Dies on AMD MI250X GPUs. We compare strong- and weak-scaling capabilities, linear solver performance, and time to solution. We also identify leading inhibitors to parallel scaling.
研究动机与目标
- 评估NekRS与AMR-Wind在现代GPU加速HPC系统上进行ABL流动模拟的可扩展性与性能。
- 通过提升代码在百亿亿次架构下的效率与保真度,实现风力发电场与区域天气的高保真LES模拟。
- 识别并行缩放中的性能瓶颈,特别是线性求解器与通信密集型内核。
- 协同开发两套代码,以增强其在百亿亿次部署中的模型精度与计算效率。
- 在Summit与Crusher系统上,使用最多4,800块GPU展示强缩放与弱缩放性能,验证其百亿亿次计算准备度。
提出的方法
- 在橡树岭领导力设施系统上,使用NekRS与AMR-Wind对GABLS基准问题开展大涡模拟(LES)。
- 采用NekRS——一种高阶、非结构化网格谱元法代码——以及AMR-Wind——一种带自适应网格细化的块结构、二阶有限体积法代码。
- 在Summit系统上测量4–800个节点(24–4,800块V100 GPU)以及在Crusher系统上测量18–384个图形计算芯片(MI250X GPU)的强缩放与弱缩放性能。
- 对关键计算内核(包括非线性对流项与压力泊松求解)进行性能分析,以识别缩放瓶颈。
- 在主机CPU上使用代数多重网格法(hypre)进行粗网格求解,并分析运行时间、迭代次数以及运行时间与物理时间的比值。
- 比较不同问题规模与处理器数量下的性能表现,重点关注2的幂次处理器数量对AMR-Wind块结构分解的影响。
实验结果
研究问题
- RQ1NekRS与AMR-Wind在Summit与Crusher等GPU加速的百亿亿次级系统上如何缩放?
- RQ2在现代HPC架构上,大气边界层流动大涡模拟的主要性能瓶颈是什么?
- RQ3线性求解器预条件子的选择如何影响LES模拟中的收敛性与可扩展性?
- RQ4AMR-Wind的性能在多大程度上依赖于2的幂次处理器数量,这与其块结构设计有关?
- RQ5在百亿亿次系统上,能否使运行时间与物理时间的比值(rt)保持在1以下,以支持天气与风能建模?
主要发现
- NekRS在每GPU 200万个点、n/P = 200万点每GPU时,实现0.11秒/物理秒的运行时间,平行效率达80%。
- AMR-Wind在所有测试的问题规模与GPU数量下,性能均达到NekRS的1.4–2.0倍。
- 压力泊松求解被识别为两种代码中限制强缩放的主要通信密集型瓶颈。
- 当GPU数量为2的幂次时,AMR-Wind因更优的块分解而获得显著性能提升,平行效率最高提升达36%。
- 对于NekRS,单个AMD MI250X图形计算芯片在Summit上的性能与单个NVIDIA V100 GPU相当。
- 由于固定域尺寸下时间步数随线性分辨率加倍而加倍,运行时间与物理时间的比值(rt)也随分辨率加倍而翻倍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。