[論文レビュー] VELOC: VEry Low Overhead Checkpointing in the Age of Exascale
VELOC は、I/O オーバーヘッドを最小限に抑え、耐障害性を向上させるために、エクサスケール HPC ワークロード向けに本番環境対応の、多層的で非同期のチェックポイント管理システムである。シンプルなユーザー API を提供し、バーストバッファやローカルメモリを含む異種ストレージを透明に活用する。バックグラウンドでのチェックポイント作成を可能にし、ランタイムへの干渉を最小限に抑え、Summit で最大 224 TB/s の I/O スループットを達成した。
Checkpointing large amounts of related data concurrently to stable storage is a common I/O pattern of many HPC applications. However, such a pattern frequently leads to I/O bottlenecks that lead to poor scalability and performance. As modern HPC infrastructures continue to evolve, there is a growing gap between compute capacity vs. I/O capabilities. Furthermore, the storage hierarchy is becoming increasingly heterogeneous: in addition to parallel file systems, it comprises burst buffers, key-value stores, deep memory hierarchies at node level, etc. In this context, state of art is insufficient to deal with the diversity of vendor APIs, performance and persistency characteristics. This extended abstract presents an overview of VeloC (Very Low Overhead Checkpointing System), a checkpointing runtime specifically design to address these challenges for the next generation Exascale HPC applications and systems. VeloC offers a simple API at user level, while employing an advanced multi-level resilience strategy that transparently optimizes the performance and scalability of checkpointing by leveraging heterogeneous storage.
研究の動機と目的
- 計算能力が I/O バンド幅を上回るエクサスケール HPC システムにおける増大する I/O ボトルネックに対処する。
- 外部ストレージに依存する従来のチェックポイント管理の限界を克服し、I/O 競合やスケーラビリティの悪化を防ぐ。
- バーストバッファ、キーバリューストア、並列ファイルシステムを含む多様なストレージスタックで動作する、ポータブルでスケーラブルかつ高性能なチェックポイント管理ソリューションを提供する。
- アイドルリソースを知的に活用し、ストレージレイヤー間でのデータ移動を最適化することで、バックグラウンドでのチェックポイント作成によるランタイム干渉を最小限に抑える。
- ディープラーニングやデータ集約型科学計算など、新たな HPC ワークロードに効率的で低オーバーヘッドのチェックポイント管理を提供する。
提案手法
- アプリケーションが重要なメモリ領域を宣言できるシンプルな集約 API を提供し、宣言とチェックポイント開始を分離する。
- ノードローカルストレージ(例:DRAM、NVRAM)を高速な中間レイヤーとして使用する、透明な多層的チェックポイント戦略を実装する。
- Lustre や DAOS などの外部ストレージへの非同期的でバックグラウンドでのフラッシュ処理を実装し、ブロッキングや I/O 競合を低減する。
- メモリレイアウトとアクセスパターンに基づく知的なデータ移動およびシリアル化最適化を適用し、I/O 量を削減し、効率を向上させる。
- DAOS などの先進的なストレージシステムと、最適化されたキーバリューアプリケーションインターフェースを介して統合し、スケーラブルで低レイテンシのチェックポイント管理を実現する。
- DeepClone やデータステートなどの技術を活用し、ディープラーニングワークロード向けにゼロコピーのモデルレプリケーションとラインレージアウェアなチェックポイント発見を可能にする。
実験結果
リサーチクエスチョン
- RQ1エクサスケールシステムにおいて、計算能力と I/O バンド幅の比が極めて高い状況で、チェックポイントのオーバーヘッドをどのように最小限に抑えられるか?
- RQ2ローカルメモリ、バーストバッファ、並列ファイルシステムを含む異種ストレージレイヤーを最適に活用することで、チェックポイントのパフォーマンスと耐障害性をどのように向上できるか?
- RQ3バックグラウンドでのチェックポイント作成をどのようにスケジューリングすれば、ランタイム干渉を避けつつ低レイテンシを維持できるか?
- RQ4一様でポータブルな API が、HPC プラットフォーム全体で多様なストレージ API やハードウェア特性の複雑さを抽象化できるか?
- RQ5頻繁で細粒度のモデルスナップショットを必要とするディープラーニングワークロードに、チェックポイント管理を効率的に拡張できるか?
主な発見
- VELOC は、Summit におけるローカルメモリ内チェックポイントで最大 224 TB/s の I/O スループットを達成し、優れたスケーラビリティを示した。
- フルスケールのアプリケーション実行時でも、バックグラウンドでローカルチェックポイントを Lustre にフラッシュする際、ランタイムへの影響がほとんどなかった。
- ノードローカルストレージを高速な中間レイヤーとして使用することで、高コストな外部 I/O 操作の頻度が低下し、全体の I/O 効率が向上した。
- 最適化されたキーバリューアプリケーションインターフェースを介した DAOS との統合により、次世代のスケーラブルなストレージシステムへの拡張性が実証された。
- VELOC は、Summit、Sierra、Fugaku といった準エクサスケールシステム上で、HACC、LatticeQCD、EXAALT といった本番 HPC アプリケーションを正常にサポートした。
- DeepClone やデータステートなどの技術により、ディープラーニングモデルの効率的でゼロコピーのレプリケーションが可能になり、チェックポイントのレイテンシが低減し、ラインレージアウェアなモデル管理が実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。