[論文レビュー] System-level Scalable Checkpoint-Restart for Petascale Computing
本論文は、DMTCPを用いて、32,752コアで1%未満のランタイムオーバーヘッドで、ペタスケールHPCシステムにおけるシステムレベルで透明なチェックポイント再起動メカニズムを提示する。InfiniBand UDモードの仮想化とランタイムトレースの最適化により、スケーラブルなチェックポイントを実現し、スタンピードスーパーコンピュータ上で38 TBのチェックポイントを10.9分で生成した。性能への影響は最小限に抑えられた。
Fault tolerance for the upcoming exascale generation has long been an area of active research. One of the components of a fault tolerance strategy is checkpointing. Petascale-level checkpointing is demonstrated through a new mechanism for virtualization of the InfiniBand UD (unreliable datagram) mode, and for updating the remote address on each UD-based send, due to lack of a fixed peer. Note that InfiniBand UD is required to support modern MPI implementations. An extrapolation from the current results to future SSD-based storage systems provides evidence that the current approach will remain practical in the exascale generation. This transparent checkpointing approach is evaluated using a framework of the DMTCP checkpointing package. Results are shown for HPCG (linear algebra), NAMD (molecular dynamics), and the NAS NPB benchmarks. In tests up to 32,752 MPI processes on 32,752 CPU cores, checkpointing of a computation with a 38 TB memory footprint in 11 minutes is demonstrated. Runtime overhead is reduced to less than 1%. The approach is also evaluated across three widely used MPI implementations.
研究の動機と目的
- ペタスケールおよびエクサスケールスケールにおけるシステムレベルのフォールトトレランスの重要な課題に取り組むこと。従来のチェックポイント手法は、I/Oおよび通信のオーバーヘッドが高いため、そのスケーリングに失敗する。
- 最新のMPI実装がパフォーマンス向上に使用するInfiniBand UDを基盤とする、大規模HPCシステムにおける透過的かつフルメモリーダンプによるチェックポイント再起動を可能にすること。
- 実行中の送信メッセージおよびネットワーク状態の処理を最適化することで、特に大規模システムにおいてチェックポイントのランタイムオーバーヘッドを低減すること。
- HPCG、NAMD、NAS NPBといった実世界のHPCワークロードにおいて、システムレベルのチェックポイントの実用的スケーラビリティを実証すること。
提案手法
- DMTCPチェックポイントフレームワークを拡張し、InfiniBand RCおよびUDモードの両方をサポートすることで、最新のMPIランタイムにおける透過的チェックポイントを実現。
- 動的ピアアドレスおよび送信中データを処理できるように、InfiniBand UDモードの仮想化を導入。これは、スケーラブルなMPI通信に不可欠である。
- 実行中の送信メッセージの継続的トレースを回避することで、ランタイムオーバーヘッドを低減する新しいチェックポイント時戦略を実装。
- 純粋なRCモードの$n^2$接続オーバーヘッドを回避するため、ハイブリッドRC/UD通信モデルを採用し、パフォーマンスとスケーラビリティのバランスを図る。
- 大規模なチェックポイントイメージの高スルーレート安定保存のため、Lustre並列ファイルシステムを活用。
- 3.4節の式を用いて、将来のSSDベースのエクサスケールシステムへの性能を外挿し、理想的なチェックポイント時間を1.7分と予測。
実験結果
リサーチクエスチョン
- RQ1ペタスケールHPCシステムにおいて、フルメモリーダンプを用いてランタイムパフォーマンスを低下させることなく、システムレベルの透過的チェックポイントをスケーラブルに実現できるか?
- RQ2最新のMPI実装に不可欠なInfiniBand UDモードは、固定ピアアドレスを持たないが、透過的チェックポイントにおいてもそのサポートが可能か?
- RQ3特に、過去の手法が4Kコアで9%までオーバーヘッドが増大したのに対し、大規模スケールで1%未満のランタイムオーバーヘッドを達成するにはどのような技術が必要か?
- RQ4提案手法は、NAMD や HPCG といった多様なMPI実装および実世界のHPCワークロードにおいても、パフォーマンスとスケーラビリティを維持できるか?
- RQ5将来的なSSDベースのストレージを想定したエクサスケールシステムにおいて、現在のアプローチは実用的であるか?
主な発見
- スタンピードスーパーコンピュータ上で32,752コアを用いて、38 TBのチェックポイントイメージを10.9分で正常に生成し、実用的なペタスケールチェックポイントを実証した。
- 32,752コアでもランタイムオーバーヘッドが1%未満に抑えられ、4Kコアで9%のオーバーヘッドが観測された先行研究を克服した。
- MVAPICH2を含む3つの広く使われているMPI実装において、アプリケーションレベルの変更なしに透過的チェックポイントを正常にサポートした。
- システム管理者による大規模実行時の監視結果から、並列I/O使用量への影響が最小限に抑えられ、同時にフルメモリーダンプが可能であることが確認された。
- 将来のSSDベースのエクサスケールシステムへの外挿予測では、理想的なチェックポイント時間が1.7分になると予測されるが、実世界のパフォーマンスを考慮すると17分未塔の十倍程度に増加すると予想される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。