Skip to main content
QUICK REVIEW

[論文レビュー] Extreme Scale-out SuperMUC Phase 2 - lessons learned

Nicolay Hammer, Ferdinand Jamitzky|arXiv (Cornell University)|Sep 6, 2016
Advanced Data Storage Technologies参考文献 2被引用数 5
ひとこと要約

本論文は、86,016コア、2.81 PetaFLOPのスーパーコンピュータSuperMUC Phase 2で実施された28日間の極限規模拡張ワークショップから得られた教訓を提示する。14のHPCアプリケーションにおけるMPIおよびハイブリッドOpenMP/MPIのスケーリングを評価した結果、ハイブリッドモデルはスケールアップにおいてパフォーマンスを向上させる一方で、MPIのオーバーヘッドとメモリ制限が、ペタスケールワークロードにおいてアプリケーションレベルのチューニングとI/O戦略の計画が不可欠な主要なボトルネックとして浮き彫りになった。

ABSTRACT

In spring 2015, the Leibniz Supercomputing Centre (Leibniz-Rechenzentrum, LRZ), installed their new Peta-Scale System SuperMUC Phase2. Selected users were invited for a 28 day extreme scale-out block operation during which they were allowed to use the full system for their applications. The following projects participated in the extreme scale-out workshop: BQCD (Quantum Physics), SeisSol (Geophysics, Seismics), GPI-2/GASPI (Toolkit for HPC), Seven-League Hydro (Astrophysics), ILBDC (Lattice Boltzmann CFD), Iphigenie (Molecular Dynamic), FLASH (Astrophysics), GADGET (Cosmological Dynamics), PSC (Plasma Physics), waLBerla (Lattice Boltzmann CFD), Musubi (Lattice Boltzmann CFD), Vertex3D (Stellar Astrophysics), CIAO (Combustion CFD), and LS1-Mardyn (Material Science). The projects were allowed to use the machine exclusively during the 28 day period, which corresponds to a total of 63.4 million core-hours, of which 43.8 million core-hours were used by the applications, resulting in a utilization of 69%. The top 3 users were using 15.2, 6.4, and 4.7 million core-hours, respectively.

研究の動機と目的

  • 新しい86,016コアのペタスケールシステム上で、多様なHPCアプリケーションのパフォーマンスとスケーラビリティを評価すること。
  • 特にMPIのオーバーヘッドとメモリ使用量に関連する、極限規模HPCワークロードにおけるシステムレベルおよびアプリケーションレベルの課題を特定すること。
  • ハイブリッドOpenMP/MPIプログラミングモデルが、スケーラビリティの向上と通信コストの低減にどの程度効果を発揮するかを評価すること。
  • 大規模スーパーコンピューティングキャンペーンにおけるI/O戦略、チェックポイント処理、システム準備のベストプラクティスを構築すること。
  • ワークショップ段階における排他的なシステム全体のジョブスケジューリングを通じて、ハードウェアおよびソフトウェアのバグを検出・是正すること。

提案手法

  • 86,016コア(194 TB RAM、15 PB GPFSストレージを備える)SuperMUC Phase 2システムを14のHPCアプリケーションが28日間の極限規模拡張ワークショップ期間中に排他的に使用した。
  • MPI、OpenMP、またはハイブリッドモデルを使用した14の多様なHPCアプリケーションの間で、消費電力、ジョブ実行時間、スケーリング特性を測定した。
  • FLASH、BQCD、CIAOなどの主要コードについて、強スケーリングおよび弱スケーリングを評価し、格子サイズおよびコア数を最大86,016まで変更した。
  • MPIスタックメモリ使用量と起動時間を、特にスケールアップ時に顕著なパフォーマンスボトル neck として分析した。
  • ノードレベルのパフォーマンス最適化と通信オーバーヘッドの低減を目的に、MPIタスクあたり7、14、28スレッドのOpenMPを用いたハイブリッドモデルをテストした。
  • MPIバッファインデックスの制限(Integer*4)に起因する問題を特定し、内部MPI制約を克服するためのアプリケーションレベルのバッファリングを提案した。

実験結果

リサーチクエスチョン

  • RQ186,016コア、2.81 PetaFLOPのシステム上で、異なるMPIおよびハイブリッドOpenMP/MPI設定がアプリケーションのスケーリングにどのように影響を与えるか?
  • RQ2大規模HPCワークロードにおける主なパフォーマンスボトル neck は何か、特にMPIスタックメモリ使用量と起動時間に関連して?
  • RQ3消費電力はジョブサイズに伴いどのように変化するか、エネルギー効率およびインfra構築計画にどのような影響を及えるか?
  • RQ4ハイブリッドプログラミングモデルは、極限規模システム上でどの程度パフォーマンスを向上させ、通信オーバーヘッドを低減できるか?
  • RQ5新しいペタスケールスーパーコンピュータへの成功した展開に不可欠な、システムおよびアプリケーションレベルの準備戦略は何か?

主な発見

  • 28日間でシステムの利用率は69%に達し、アプリケーションが合計4380万コアアワーを消費した。上位3つのユーザーがそれぞれ1520万、640万、470万コアアワーを消費した。
  • 消費電力はジョブサイズにほぼ線形に比例し、最大ジョブでは1.2 MWを超えた。SeisSolはILBDCのようなメモリバウンドコードと比較して顕著に高いエネルギー消費を示した。
  • BQCD共役勾配ソルバーでは、ハイブリッドモデル(MPIタスクあたり7個のOpenMPスレッド)が全システムで純粋なMPIを上回り、86,016コアで最良のパフォーマンスを記録した。
  • MPI起動時間とスタックメモリ使用量が、特に大規模ジョブにおいて顕著なパフォーマンスボトル neck となった。スタックメモリはノードメモリの非小規模な割合を占めていた。
  • MPIインデックス値のInteger*4制限によりバッファオーバーフローが発生し、これはアプリケーションレベルの内部バッファリングによるみに解決された。
  • 極限規模拡張モードにより、通常の共有運用ではほぼ孤立不可能だった、複合的なタイムアウトとハードウェア故障を併発するレアなハードウェアバグを検出できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。