Skip to main content
QUICK REVIEW

[论文解读] Extreme Scale-out SuperMUC Phase 2 - lessons learned

Nicolay Hammer, Ferdinand Jamitzky|arXiv (Cornell University)|Sep 6, 2016
Advanced Data Storage Technologies参考文献 2被引用 5
一句话总结

本文介绍了在拥有86,016个核心的2.81 PetaFLOP超级计算机SuperMUC Phase 2上进行的28天极端规模扩展研讨会的经验总结。该研究评估了14个HPC应用在MPI及混合OpenMP/MPI模型下的可扩展性,发现混合模型在大规模计算中能提升性能,而MPI开销和内存限制则成为关键瓶颈,需通过应用级调优和I/O策略规划来应对大规模计算工作负载。

ABSTRACT

In spring 2015, the Leibniz Supercomputing Centre (Leibniz-Rechenzentrum, LRZ), installed their new Peta-Scale System SuperMUC Phase2. Selected users were invited for a 28 day extreme scale-out block operation during which they were allowed to use the full system for their applications. The following projects participated in the extreme scale-out workshop: BQCD (Quantum Physics), SeisSol (Geophysics, Seismics), GPI-2/GASPI (Toolkit for HPC), Seven-League Hydro (Astrophysics), ILBDC (Lattice Boltzmann CFD), Iphigenie (Molecular Dynamic), FLASH (Astrophysics), GADGET (Cosmological Dynamics), PSC (Plasma Physics), waLBerla (Lattice Boltzmann CFD), Musubi (Lattice Boltzmann CFD), Vertex3D (Stellar Astrophysics), CIAO (Combustion CFD), and LS1-Mardyn (Material Science). The projects were allowed to use the machine exclusively during the 28 day period, which corresponds to a total of 63.4 million core-hours, of which 43.8 million core-hours were used by the applications, resulting in a utilization of 69%. The top 3 users were using 15.2, 6.4, and 4.7 million core-hours, respectively.

研究动机与目标

  • 评估新型86,016核大规模计算系统上多种HPC应用的性能与可扩展性。
  • 识别极端规模HPC工作负载中的系统级与应用级挑战,特别是MPI开销和内存使用问题。
  • 评估混合OpenMP/MPI编程模型在提升可扩展性和降低通信开销方面的有效性。
  • 为大规模超级计算任务中的I/O策略、检查点机制和系统准备制定最佳实践。
  • 通过研讨会阶段的独占式全系统作业调度,检测并修复硬件与软件错误。

提出的方法

  • 开展为期28天的极端规模扩展研讨会,允许单个应用独占使用整个SuperMUC Phase 2系统(86,016个核心,194 TB内存,15 PB GPFS存储)。
  • 通过MPI、OpenMP或混合模型测量14个不同HPC应用的功耗、作业运行时间及可扩展性行为。
  • 针对FLASH、BQCD和CIAO等关键代码评估强可扩展性和弱可扩展性,使用最大达86,016个核心的晶格尺寸和核心数量。
  • 分析MPI栈内存使用量和启动时间作为关键性能瓶颈,尤其在大规模环境下表现显著。
  • 测试每MPI任务7、14或28个OpenMP线程的混合模型,以优化节点级性能并减少通信开销。
  • 识别出MPI缓冲区索引(Integer*4)的限制,并提出应用级缓冲机制以克服内部MPI约束。

实验结果

研究问题

  • RQ1不同的MPI和混合OpenMP/MPI配置如何影响在2.81 PetaFLOP、86,016核心系统上的应用可扩展性?
  • RQ2大规模HPC工作负载中的主要性能瓶颈是什么,特别是与MPI栈内存和启动时间相关的问题?
  • RQ3功耗如何随作业规模变化?对能效和基础设施规划有何影响?
  • RQ4混合编程模型在极端规模系统上能在多大程度上提升性能并减少通信开销?
  • RQ5在新型大规模超级计算机上成功部署时,系统级与应用级准备策略有哪些关键要素?

主要发现

  • 28天内系统整体利用率达69%,应用共使用4380万核心小时,其中前三名用户分别消耗1520万、640万和470万核心小时。
  • 功耗几乎随作业规模线性增长,最大作业功耗超过1.2 MW,SeisSol的能耗显著高于内存受限代码(如ILBDC)。
  • 对于BQCD共轭梯度求解器,混合模型(每MPI任务7个OpenMP线程)在全系统规模下优于纯MPI模型,在86,016个核心时达到最佳性能。
  • MPI启动时间和栈内存使用量成为显著性能瓶颈,尤其在大规模作业中,栈内存占用了节点内存的非可忽略部分。
  • MPI索引值中的Integer*4限制导致缓冲区溢出问题,仅通过应用级内部缓冲机制得以解决。
  • 极端规模扩展模式使罕见且复杂的硬件错误(如组合超时与硬件故障)得以被检测,这些错误在常规共享运行环境下几乎无法被隔离。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。