Skip to main content
QUICK REVIEW

[论文解读] Mistral Supercomputer Job History Analysis

Michał Zasadziński, Víctor Muntés-Mulero|arXiv (Cornell University)|Jan 23, 2018
AI-based Problem Solving and Planning参考文献 1被引用 3
一句话总结

本文基于Mistral百亿亿次级超级计算机(3.14 PFLOPS,3,300个节点)的作业历史数据,结合Slurm调度器数据、硬件指标和功耗监控,分析故障模式。研究发现,失败作业消耗的CPU小时数显著高于成功作业,使用更多节点和机架(尤其在约7个机架时),且平均功耗更低,表明早期检测故障可显著节省高性能计算(HPC)环境中的资源。

ABSTRACT

In this technical report, we show insights and results of operational data analysis from petascale supercomputer Mistral, which is ranked as 42nd most powerful in the world as of January 2018. Data sources include hardware monitoring data, job scheduler history, topology, and hardware information. We explore job state sequences, spatial distribution, and electric power patterns.

研究动机与目标

  • 研究大规模HPC系统中的故障模式,以提高资源利用率和系统可靠性。
  • 识别作业特征(如节点数、机架数、持续时间)与在百亿亿次级超级计算机中故障状态之间的相关性。
  • 分析不同作业完成状态下的功耗趋势,以检测预示故障的异常情况。
  • 理解作业规模和硬件配置对故障概率及持续时间的影响。
  • 通过利用真实HPC环境中采集的运维数据,支持复杂IT系统的根本原因分析。

提出的方法

  • 收集并处理了Mistral超级计算机在10个月生产使用期间的作业调度日志(Slurm)。
  • 整合了DKRZ数据中心的硬件监控数据、功耗指标以及拓扑信息(机架、机箱、节点类型)。
  • 分析了作业状态序列、空间分布(机架与节点)以及不同作业类型下的功耗模式。
  • 按硬件配置(如B720_36_64、B720_24_256)对作业进行分组,并计算作业在完成前最后300秒内的平均功耗。
  • 使用统计分析和可视化手段(如故障概率与机架数量关系图)检测趋势。
  • 评估了作业优先级、持续时间与故障状态之间的相关性,识别出如高优先级超时等异常情况。

实验结果

研究问题

  • RQ1分配的节点数、机架数与作业失败概率之间存在何种关系?
  • RQ2在最后300秒内,完成、失败和取消作业的功耗模式有何差异,尤其是对失败作业?
  • RQ3作业持续时间或规模是否与故障概率相关?是否存在故障概率显著上升的特定阈值?
  • RQ4对于特定故障状态(如超时),是否存在可检测的作业优先级分布异常?
  • RQ5空间分布(如使用的机架数量)如何影响故障的发生频率和持续时间?

主要发现

  • 完成作业占所有提交作业的91.3%,失败作业占5.6%,其中1.7%被取消,1.4%发生超时。
  • 失败步骤平均使用18个节点,而完成步骤仅使用3.4个节点,表明失败作业的复杂度更高。
  • 当使用7个机架时,故障概率达到峰值;当分配超过13个机架(超过1,000个节点)时,故障变得极为罕见。
  • 对于使用少于10个机架的作业,失败作业的持续时间短于完成作业;而对于使用超过12个机架的作业,失败作业的持续时间显著更长。
  • 失败作业消耗的CPU小时数多于完成作业,完成步骤的平均持续时间约为414秒,而失败步骤接近其三倍。
  • 在最后300秒内,失败作业的功耗始终低于完成作业(如B720-compute_36_64为172W,而完成作业为176W),表明故障后可能提前进入空闲状态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。