Skip to main content
QUICK REVIEW

[論文レビュー] A Workload Analysis of NSF's Innovative HPC Resources Using XDMoD

Nikolay A. Simakov, Joseph P. White|arXiv (Cornell University)|Jan 12, 2018
Distributed and Parallel Computing Systems参考文献 2被引用数 17
ひとこと要約

この論文は、2011年から2017年までのNSFのイノベイティブHPCリソースのワークロードをXDMoDを用いて分析し、割り当ての使用率が高く(90%の割り当てが使用済み)、平均ジョブサイズが約9,000コアから約1,000コアに減少し、単一ノードジョブの使用率が上昇(2017年にはSU消費の21%を占める)、生物学的・物理的科学分野におけるScience Gatewayの採用が拡大していることを明らかにした。また、TACCやSDSCのクラスタを含むシステムにおけるメモリ使用量、並列処理、I/Oパターンのトレンドも特定した。

ABSTRACT

Workload characterization is an integral part of performance analysis of high performance computing (HPC) systems. An understanding of workload properties sheds light on resource utilization and can be used to inform performance optimization both at the software and system configuration levels. It can provide information on how computational science usage modalities are changing that could potentially aid holistic capacity planning for the wider HPC ecosystem. Here, we report on the results of a detailed workload analysis of the portfolio of supercomputers comprising the NSF Innovative HPC program in order to characterize its past and current workload and look for trends to understand the nature of how the broad portfolio of computational science research is being supported and how it is changing over time. The workload analysis also sought to illustrate a wide variety of usage patterns and performance requirements for jobs running on these systems. File system performance, memory utilization and the types of parallelism employed by users (MPI, threads, etc) were also studied for all systems for which job level performance data was available.

研究の動機と目的

  • NSFのイノベイティブHPCリソースにおけるワークロードパターンの変化を特徴づけ、システム最適化と容量計画に資する。
  • ジョブサイズ、並列処理、リソース使用率のトレンドを含む、計算科学の使用モダリティの変化を理解する。
  • Science GatewaysがHPC利用に果たす役割と、ユーザーへのアクセス拡大およびジョブスループットへの影響を評価する。
  • メモリ、I/O、インターコネクト使用量といったシステムレベルのメトリクスを分析し、パフォーマンスのボトル neck や最適化の機会を特定する。
  • アーキテクチャ変更(例:TACC STAMPEDE2)がジョブ特性およびリソース消費パターンに与える影響を定量化する。

提案手法

  • 2011年から2017年までの8つの主要HPCシステムにおいて、XDMoD(XSEDEモニタリングシステム)を用いてジョブアカウンティングおよびパフォーマンスデータを収集・分析した。
  • /proc/stat、/sys/devices/system/node/、および/proc/sys/lnet/statsからのジョブレベルのメトリクスを用い、CPU、メモリ、I/O、インターコネクト使用量を算出した。
  • LariatおよびXALTツールを用いて実行可能ファイルのパスを抽出し、既知のコミュニティソフトウェアデータベースに基づきアプリケーションを分類した。
  • ユニークなPIDの数を数え、システムデーモンを除外することで、主ジョブステップを特定する分類アルゴリズムを実装した。
  • 正規表現と188個の既知アプリケーションの参照データベースを用いてジョブをカテゴリ別に分類し、未分類のジョブの分類を改善するために機械学習を適用した。
  • サブサンプリングされた瞬間データから、平均および最大メモリ使用量、I/Oレート(読み取り/書き込み)、帯域幅使用率といった派生メトリクスを算出した。

実験結果

リサーチクエスチョン

  • RQ12011年から2017年にかけて、NSFのHPCリソースの使用率はどのように変化したのか。割り当て使用率の変化を引き起こす要因は何か。
  • RQ2異なる科学分野におけるジョブサイズ、並列処理タイプ(MPI、スレッド)、メモリ消費量のトレンドは何か。
  • RQ3Science Gatewaysの採用は、ジョブスループット、ユーザーの属性、リソース消費パターンにどのように影響したか。
  • RQ4HPCアプリケーションの多くが帯域幅制限を受けている程度はどの程度か。また、インターコネクト使用量はジョブサイズやパフォーマンスとどのように相関しているか。
  • RQ5アーキテクチャ変更(例:TACC STAMPEDE2)は、ジョブ特性およびシステム効率にどのような影響を与えたか。

主な発見

  • 全体的な割り当て使用率は高く、使用されなかった割り当ては10%にとどまり、2011年以降、NSFの専門委員会全体での使用量は2桁増加した。
  • 数学・物理学科学(MPS)および生物学的科学(BIO)専門委員会が、全XD SUsの70%を占め、その半数は分子生物学、物理学、材料研究分野からの寄与であった。
  • 単一ノードジョブは2011年のXD SUsの5%から2017年には21%に増加し、2017年にはシリアルジョブが全XD SUsの少なくとも3%を占めた。
  • 平均ジョブサイズが減少しているにもかかわらず、TACC STAMPEDE2の導入により、近年は8,000コア以上の大型ジョブの使用が増加しており、高コアワークロードへのシフトが顕著である。
  • 大多数の並列ジョブは、割り当てられたCPUコアをすべてまたはほぼすべて効率的に使用しており、多数のジョブがマルチスレッドではなく、複数の単一スレッドプロセスを用いている。
  • Science Gatewayの利用は2011年から2017年にかけて5倍に増加し、Gateway SUsの98%が生物学的および数学/物理科学分野で消費された。2015年をピークに、Gatewayユーザーの数がHPCユーザーを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。