[論文レビュー] Converging High-Throughput and High-Performance Computing: A Case Study.
本論文は、ATLASがTitanというリーダーシップクラスのスーパーコンピュータを、既存のハイドロウプットコンピューティングインfra構造と統合した事例研究を提示しており、年間約5100万コアアワーの持続的生産ワークロードを達成した。本研究では、スケーラブルなスーパーコンピュータ利用のための設計および運用戦略を評価し、先進的ワークロードをサポートする次世代PanDAエグゼキュータを導入し、実験システムを生産用スーパーコンピューティングプラットフォームと統合するためのフレームワークを確立した。
The computing systems used by LHC experiments has historically consisted of the federation of hundreds to thousands of distributed resources, ranging from small to mid-size resource. In spite of the impressive scale of the existing distributed computing solutions, the federation of small to mid-size resources will be insufficient to meet projected future demands. This paper is a case study of how the ATLAS experiment has embraced Titan -- a DOE leadership facility in conjunction with traditional distributed high-throughput computing to reach sustained production scales of approximately 51M core-hours a years. The three main contributions of this paper are: (i) a critical evaluation of design and operational considerations to support the sustained, scalable and production usage of Titan; (ii) a preliminary characterization of a next generation executor for PanDA to support new workloads and advanced execution modes; and (iii) early lessons for how current and future experimental and observational systems can be integrated with production supercomputers and other platforms in a general and extensible manner.
研究の動機と目的
- リーダーシップクラスのスーパーコンピュータ(例:Titan)を、高エネルギー物理学分野における持続的かつ大規模な生産ワークロードに効果的かつ持続可能に統合するための設計的および運用的課題を評価すること。
- 将来のワークロードおよび高度な実行モードをサポートするための、次世代のPanDAワークロード管理システム用エグゼキュータを開発・特徴づけること。
- 実験的および観測的システムを生産用スーパーコンピューティングプラットフォームと統合するための一般的で拡張可能なフレームワークを確立すること。
- ハイドロウプットコンピューティングとハイパフォーマンスコンピューティングを生産環境で統合する可能性とパフォーマンスを評価すること。
提案手法
- ORNLに所在するTitanリーダーシップクラススーパーコンピュータとATLASのワークロード管理システム(PanDA)の統合。
- PanDAのジョブ実行およびスケジューリングコンponentsを、Titanのアーキテクチャおよびジョブ提出ワークフローに適合させるための改造。
- 低遅延または高並列実行を要するワークロードを含む多様なワークロードを処理できる新しいエグゼキュータモジュールの設計および評価。
- ATLAS実験から得た実際の生産ワークロードを用いて、ハイブリッドHPC-HTC環境のパフォーマンスを特徴づけること。
- 長期間にわたる生産環境でのTitanにおけるジョブ提出、監視、障害回復のパターンを分析すること。
- ハイドロウプットコンピューティングとハイパフォーマンスコンピューティングプラットフォーム間の相互運用性を可能にする拡張可能なソフトウェアスタックの開発。
実験結果
リサーチクエスチョン
- RQ1リーダーシップクラスのスーパーコンピュータ(例:Titan)を、大規模な科学的ワークロードに効果的かつ持続可能に、既存のハイドロウプットコンピューティングインfra構造に統合するにはどうすればよいか?
- RQ2PanDAのようなハイドロウプットコンピューティングフレームワーク内で、スーパーコンピュータを生産レベルで使用可能にするために必要なアーキテクチャ的および運用的変更は何か?
- RQ3現代の科学的ワークロードが要請する多様かつ高度な実行モードをサポートできる次世代のPanDAエグゼキュータは、どのように設計できるか?
- RQ4生産用HEP環境において、リーダーシップクラスのスーパーコンピュータで持続的かつ大規模なワークロードを実行する際の主な課題とパフォーマンス特性は何か?
- RQ5多様なHPCおよびHTCプラットフォームと統合するための、実験的システムとのシームレスな統合を可能にする一般的なパターンと抽象化は何か?
主な発見
- TitanをATLASのハイドロウプットコンピューティングインfra構造と統合することで、年間約5100万コアアワーの持続的生産ワークロードを達成した。
- Titanを生産環境で使用するにあたり、設計および運用上の考慮事項が成功裏に評価され、長期にわたりスケーラビリティと信頼性が確認された。
- 次世代のPanDAエグゼキュータが開発・特徴づけられ、新しいワークロードパターンおよび実行モードのサポートが可能になった。
- ハイブリッドHPC-HTC環境は、多様なコンピューティングリソースにおいて高いリソース利用率と効果的なジョブ管理を達成した。
- 本研究では、将来的なHEPおよび観測科学のワークロードに適用可能な、一般的で拡張可能なフレームワークが確立された。
- 初期の運用上の教訓が得られ、大規模なHPC-HTCワークフローにおいて、自動監視、フォールトトレランス、動的リソース割り当ての重要性が明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。