Skip to main content
QUICK REVIEW

[論文レビュー] Mistral Supercomputer Job History Analysis

Michał Zasadziński, Víctor Muntés-Mulero|arXiv (Cornell University)|Jan 23, 2018
AI-based Problem Solving and Planning参考文献 1被引用数 3
ひとこと要約

本論文は、Mistralペタスケールスーパーコンピュータ(3.14 PFLOPS、3,300ノード)のジョブ履歴を、Slurmスケジューラデータ、ハードウェアメトリクス、電力モニタリングを用いて分析し、障害パターンを特定した。その結果、失敗したジョブは完了したジョブと比較して著しく多くのCPU時間を消費し、より多くのノードとラック(特に7ラック付近)を用いることが判明した。また、平均的な電力消費量が低く、障害の早期検出がHPC環境におけるリソースの大幅な節約につながる可能性があることが示された。

ABSTRACT

In this technical report, we show insights and results of operational data analysis from petascale supercomputer Mistral, which is ranked as 42nd most powerful in the world as of January 2018. Data sources include hardware monitoring data, job scheduler history, topology, and hardware information. We explore job state sequences, spatial distribution, and electric power patterns.

研究の動機と目的

  • 大規模HPCシステムにおける障害パターンを調査し、リソース利用効率とシステム信頼性の向上を図ること。
  • ペタスケールスーパーコンピュータにおける、ジョブの特徴(ノード数、ラック数、実行時間など)と障害状態との相関関係を特定すること。
  • さまざまなジョブ完了状態における電力消費トレンドを分析し、故障の兆候を示す異常を検出すること。
  • ジョブのサイズとハードウェア構成が、障害発生確率および継続時間に与える影響を理解すること。
  • 実世界のHPC環境からの運用データを活用して、複雑なITシステムの根本原因分析を支援すること。

提案手法

  • Mistralスーパーコンピュータで10か月間の本番運用中に得られたジョブスケジューラログ(Slurm)を収集・処理した。
  • DKRZデータセンターのハードウェア監視データ、電力メトリクス、トポロジー情報(ラック、シャーシ、ノードタイプ)を統合した。
  • ジョブステータスのシーケンス、空間的分布(ラックおよびノード)、さまざまなジョブタイプにおける電力消費パターンを分析した。
  • ハードウェアプロファイル(例:B720_36_64、B720_24_256)ごとにグループ化し、完了直前の300秒間の平均電力を算出した。
  • 統計的分析と可視化(例:ラック数と障害確率の関係図)を用いてトレンドを特定した。
  • ジョブ優先度、実行時間、障害状態の相関関係を評価し、高優先度のタイムアウトなど、異常を同定した。

実験結果

リサーチクエスチョン

  • RQ1割り当てられたノード数、ラック数とジョブ障害発生確率の間にはどのような関係があるか?
  • RQ2最終300秒における電力消費パターンは、完了、失敗、キャンセルのジョブでどのように異なるか。特に、7ラック未満や12ラック以上の場合に注目する。
  • RQ3ジョブの実行時間やサイズは障害発生確率と相関しているか。障害確率が急激に上昇する特定のしきい値があるか?
  • RQ4タイムアウトなどの特定の障害状態において、ジョブ優先度の分布に検出可能な異常があるか?
  • RQ5空間的分布(例:使用するラック数)は、障害発生頻度および継続時間にどのように影響するか?

主な発見

  • 完了ジョブは全提出の91.3%を占め、失敗ジョブは5.6%、キャンセルは1.7%、タイムアウトは1.4%であった。
  • 失敗したステップは平均18ノードを消費したが、完了ステップは3.4ノードにとどまり、失敗ジョブの複雑さが高まっていることが示された。
  • 7ラック使用時に障害確率がピークに達し、13ラックを超える割り当て(1,000ノード以上)では障害がほとんど見られなくなった。
  • 10ラック未満のジョブでは失敗ジョブの実行時間が完了ジョブより短く、12ラックを超えると失敗ジョブは著しく長くなった。
  • 失敗ジョブは完了ジョブよりも多くのCPU時間を消費しており、完了ステップの平均時間は約414秒、失敗ステップはほぼ3倍にのぼった。
  • 最終300秒の電力消費は、失敗ジョブで一貫して低く、例としてB720-compute_36_64では172Wであったのに対し、完了ジョブでは176Wであった。これは、障害後に早期にアイドル状態に移行している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。