[论文解读] A Workload Analysis of NSF's Innovative HPC Resources Using XDMoD
本论文利用XDMoD分析了2011至2017年间美国国家科学基金会(NSF)创新高性能计算(HPC)资源的工作负载,揭示了高利用率(90%的分配资源被使用)、平均作业规模从约9,000个核心下降至约1,000个核心、单节点作业使用率上升(2017年占总SU消耗的21%),以及科学门户(Science Gateway)采用率持续增长——尤其在生物和物理科学领域;同时识别出TACC和SDSC集群等系统在内存使用、并行性及I/O模式方面的趋势。
Workload characterization is an integral part of performance analysis of high performance computing (HPC) systems. An understanding of workload properties sheds light on resource utilization and can be used to inform performance optimization both at the software and system configuration levels. It can provide information on how computational science usage modalities are changing that could potentially aid holistic capacity planning for the wider HPC ecosystem. Here, we report on the results of a detailed workload analysis of the portfolio of supercomputers comprising the NSF Innovative HPC program in order to characterize its past and current workload and look for trends to understand the nature of how the broad portfolio of computational science research is being supported and how it is changing over time. The workload analysis also sought to illustrate a wide variety of usage patterns and performance requirements for jobs running on these systems. File system performance, memory utilization and the types of parallelism employed by users (MPI, threads, etc) were also studied for all systems for which job level performance data was available.
研究动机与目标
- 表征NSF创新HPC资源中工作负载模式的演变,以支持系统优化与容量规划。
- 理解计算科学使用模式的转变,包括作业规模、并行性及资源利用率趋势。
- 评估科学门户在HPC使用中的作用及其对用户访问与作业吞吐量日益增长的影响。
- 分析系统级指标(如内存、I/O及互连使用情况),以识别性能瓶颈与优化机会。
- 量化架构变更(如TACC STAMPEDE2)对作业特征与资源消耗模式的影响。
提出的方法
- 利用XDMoD(XSEDE监控系统)收集并分析2011至2017年间8个主要HPC系统的工作负载会计与性能数据。
- 通过/proc/stat、/sys/devices/system/node/及/proc/sys/lnet/stats中的作业级指标推导CPU、内存、I/O及互连使用情况。
- 使用Lariat和XALT工具提取可执行文件路径,并基于已知社区软件数据库对应用程序进行分类。
- 实现一种分类算法,通过统计唯一PID数量并过滤系统守护进程来识别主要作业步骤。
- 使用正则表达式与包含188个已知应用程序的参考数据库对作业进行分类;采用机器学习方法提升未分类作业的分类准确性。
- 从子采样瞬时数据中计算衍生指标,如平均与最大内存使用量、I/O速率(读/写)及带宽利用率。
实验结果
研究问题
- RQ12011至2017年间,NSF HPC资源的利用率如何演变?哪些因素驱动了分配使用量的变化?
- RQ2在不同科学领域中,作业规模、并行类型(MPI、线程)及内存消耗方面存在哪些趋势?
- RQ3科学门户的采用如何影响作业吞吐量、用户群体特征及资源消耗模式?
- RQ4HPC应用在多大程度上受带宽限制?互连使用情况与作业规模及性能之间有何关联?
- RQ5架构变更(如TACC STAMPEDE2)对作业特征与系统效率有何影响?
主要发现
- 总体分配利用率较高,仅有10%的分配未被使用,且自2011年以来,NSF各主任办公室的总使用量增长了两个数量级。
- 数学与物理科学(MPS)及生物科学(BIO)主任办公室占所有XD SU消耗的70%,其中分子生物学、物理及材料研究贡献了其中一半。
- 单节点作业占比从2011年的5%上升至2017年的21%,而串行作业在2017年至少占所有XD SU消耗的3%。
- 尽管平均作业规模呈下降趋势,但TACC STAMPEDE2的近期趋势显示,大规模作业(8,000个核心以上)的使用量正在增加,表明工作负载正向高核心规模转变。
- 大多数并行作业能高效使用全部或几乎全部分配的CPU核心,且多数采用多个单线程进程而非多线程程序。
- 科学门户使用量从2011年到2017年增长了五倍,其中98%的门户SU消耗集中于生物科学与数学/物理科学领域,且门户用户数量在2015年已超过传统HPC用户。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。