Skip to main content
QUICK REVIEW

[論文レビュー] Executing Dynamic and Heterogeneous Workloads on Super Computers

André Merzky, Mark Santcroos|arXiv (Cornell University)|Dec 27, 2015
Distributed and Parallel Computing Systems参考文献 44被引用数 7
ひとこと要約

本論文では、ジョブプレースホルダーと遅延バインドを用いてワークロード定義、リソース選択、タスク実行を分離することで、スーパーコンピュータ上で多様で予測不能なワークロードを動的に管理する、ポータブルでPythonベースのパイロットシステムRADICAL-Pilot (RP) を提示する。1秒間に100件以上のタスクを処理し、最大8,000件の同時タスクを維持することができ、さまざまなHPC環境においてスケーラビリティと適応性を示している。

ABSTRACT

Many scientific applications have workloads comprised of multiple heterogeneous tasks that are not known in advance and may vary in the resources needed during execution. However, high-performance computing systems are designed to support applications comprised of mostly monolithic, single-job workloads. Pilot systems decouple workload specification, resource selection, and task execution via job placeholders and late-binding. Pilot systems help to satisfy the resource requirements of workloads comprised of multiple tasks with the capabilities and usage policies of HPC systems. RADICAL-Pilot (RP) is a portable, modular and extensible Python-based Pilot system. In this paper we describe RP’s design, discuss how it is engineered, characterize its performance and show its ability to execute heterogeneous and dynamic workloads on a range of high-performance computing systems. RP is capable of spawning more than 100 tasks/second and the steady-state execution of up to 8,000 concurrent tasks. RP can be used stand-alone, as well as integrated with other application-level tools as a runtime system.

研究の動機と目的

  • 主にモノリシックで単一ジョブ向けに設計されたHPCシステムにおいて、動的かつ多様な科学的ワークロードを実行する課題に対処すること。
  • ワークロード定義、リソース選択、タスク実行を分離することで、適応性とリソース利用効率を向上させること。
  • 実行時に必要に応じてタスクをリソースにバインドする遅延バインドを実装し、リソースの可用性やワークロードの動的変化に適応可能な仕組みを提供すること。
  • さまざまなHPC環境およびアプリケーションツールと互換性がある、ポータブルでモジュラーかつ拡張可能なランタイムシステムを設計すること。
  • 実際のスーパーコンピューティングシステム上で、複雑で動的なワークロードを効率的に実行する際の高い性能とスケーラビリティを実証すること。

提案手法

  • ジョブプレースホルダーを用いてワークロード定義とリソース割り当て・実行を分離するパイロットベースの実行モデルを採用する。
  • 必要に応じてのみタスクをリソースにバインドする遅延バインドの意味論を実装し、リソースの可用性やワークロードの動的変化に実行時に適応可能にする。
  • HPCワークロード向けにモジュラーかつ拡張可能で、ポータブルなPythonベースのランタイムシステムとしてRADICAL-Pilot (RP) を設計する。
  • 非同期タスク生成と動的リソースプロビジョニングを活用し、多様なタスクの高スルーレート実行を実現する。
  • アプリケーションレベルのツールと統合されたランタイムシステムとしてRPを実装し、科学的ワークフローへのシームレスな統合を可能にする。
  • オーバーヘッドを最小限に抑え、並列実行とスルーレートを最大化するためのタスクスケジューリングとリソース管理を最適化する。

実験結果

リサーチクエスチョン

  • RQ1HPCシステム上で実行時に未知のリソース要件を持つ動的かつ多様なワークロードを、パイロットシステムが効果的に管理できるか。
  • RQ2Pythonベースのパイロットシステムは、スーパーコンピュータ上でタスクスルーレートと並列実行性においてどのような性能を示すか。
  • RQ3RADICAL-Pilotのようなモジュラーかつ拡張可能なパイロットシステムは、数千件の同時タスクをサポートするまでにどの程度スケーラブルか。
  • RQ4遅延バインドとワークロード定義の実行からの分離は、HPC環境における適応性とリソース利用効率をどのように向上させるか。
  • RQ5RADICAL-Pilotは単体としてのシステムとして効果的に使用可能か、あるいは既存のアプリケーションレベルツールのランタイムコンponentとして統合可能か。

主な発見

  • RADICAL-Pilotは1秒間に100件を超えるタスク生成レートを達成し、動的ワークロードに対する高いスルーレートを示している。
  • システムは最大8,000件の同時タスクを安定して実行でき、HPCシステムにおける強力なスケーラビリティを示している。
  • タスク定義とリソースバインディングの分離により、リソース要件が異なる多様なワークロードを効果的に管理している。
  • システムはポータブルかつ拡張可能であり、他のアプリケーションレベルツールとの統合を実現するランタイム環境としてのサポートを提供している。
  • 遅延バインドとジョブプレースホルダーの使用により、リソースの可用性やワークロード特性の実行時変化に効果的に適応可能である。
  • RADICAL-Pilotの設計により、多様なハイパフォーマンスコンピューティングプラットフォーム上で複雑で動的な科学的ワークフローを効率的に実行できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。