Skip to main content
QUICK REVIEW

[論文レビュー] Modular Resource Centric Learning for Workflow Performance Prediction

Alok Singh, Mai H. Nguyen|arXiv (Cornell University)|Nov 15, 2017
Scientific Computing and Data Management参考文献 20被引用数 3
ひとこと要約

本論文では、分散システムにおけるワークフロー実行の性能予測を向上させるために、モジュラーでリソース中心の機械学習アプローチを提案する。ワークフローを物理的リソース実行計画(PREP)に変換し、リソースタイプごとに専用のモデルを訓練することで、さまざまな混雑状態下での動的および静的特徴を捉え、大規模プラットフォーム上での複雑なワークフローにおける予測精度を顕著に向上させる。

ABSTRACT

Workflows provide an expressive programming model for fine-grained control of large-scale applications in distributed computing environments. Accurate estimates of complex workflow execution metrics on large-scale machines have several key advantages. The performance of scheduling algorithms that rely on estimates of execution metrics degrades when the accuracy of predicted execution metrics decreases. This in-progress paper presents a technique being developed to improve the accuracy of predicted performance metrics of large-scale workflows on distributed platforms. The central idea of this work is to train resource-centric machine learning agents to capture complex relationships between a set of program instructions and their performance metrics when executed on a specific resource. This resource-centric view of a workflow exploits the fact that predicting execution times of sub-modules of a workflow requires monitoring and modeling of a few dynamic and static features. We transform the input workflow that is essentially a directed acyclic graph of actions into a Physical Resource Execution Plan (PREP). This transformation enables us to model an arbitrarily complex workflow as a set of simpler programs running on physical nodes. We delegate a machine learning model to capture performance metrics for each resource type when it executes different program instructions under varying degrees of resource contention. Our algorithm takes the prediction metrics from each resource agent and composes the overall workflow performance metrics by utilizing the structure of the corresponding Physical Resource Execution Plan.

研究の動機と目的

  • 大規模な分散プラットフォーム上でのワークフローエグゼキューションにおける性能予測の不正確さという課題に対処すること。
  • ワークフロー実行メトリクスのより正確な推定を提供することで、スケジューリングアルゴリズムの効率を向上させること。
  • 特定のリソース上でのプログラム命令と性能メトリクスの複雑な関係をモデル化すること。
  • 複雑なワークフローを、より良い予測の粒度を得るための単純化されたリソース固有の実行ユニットに分解すること。
  • PREP構造を用いて、個々のリソースレベルの予測を組み合わせて、全体のワークフロー性能メトリクスを算出すること。

提案手法

  • ワークフローの有向非巡回グラフ(DAG)を物理的リソース実行計画(PREP)に変換し、アクションを物理的ノードにマッピングすること。
  • リソースタイプごとに分離された機械学習エージェントを訓練し、リソース混雑状態の変化に伴う性能メトリクスをモデル化すること。
  • 各リソースエージェントの入力として、特定のリソース上で実行されるプログラム命令の静的および動的特徴を捉えること。
  • PREP構造を用いて、個々のリソース予測を統合し、エンドツーエンドのワークフロー性能推定値を算出すること。
  • ワークフローの実行計画とリソース割り当てに基づき、リソース固有モデルからの予測を集約すること。
  • 各リソースタイプに独自のトレーニング済みモデルを持つモジュラー学習フレームワークを適用することで、スケーラブルかつ正確な予測を実現すること。

実験結果

リサーチクエスチョン

  • RQ1大規模な分散環境および異種リソースを有する状況下で、どのようにしてワークフロー性能予測の正確性を向上させることができるか?
  • RQ2ワークフロー全体ではなく、リソースレベルで性能をモデル化することは、どのような影響を及ぼすか?
  • RQ3ワークフローをリソース固有の実行計画に分解することで、予測の粒度と正確性を向上させることができるか?
  • RQ4プログラム命令の動的および静的特徴は、リソース混雑状態の変化に伴い、性能予測にどのように影響を与えるか?
  • RQ5モジュラーでリソース中心のアプローチは、モノリシックな予測モデルに比べて、どの程度優れているか?

主な発見

  • モジュラーでリソース中心のアプローチにより、混雑状態の変化に応じたリソース固有の挙動をモデル化することで、予測精度が顕著に向上した。
  • 物理的リソース実行計画(PREP)の使用により、ワークフローのアクションを物理的ノードに正確にマッピングでき、モデルの解釈可能性と正確性が向上した。
  • リソースタイプごとに専用の機械学習エージェントを訓練することで、命令と性能メトリクスの間の複雑で非線形な関係をよりよく捉えることができた。
  • 多様で動的な分散コンピューティング環境において、実行時間の予測に際して、より高いロバスト性を示した。
  • PREP構造を用いて個々のリソースエージェントからの予測を組み合わせることで、信頼性の高いエンドツーエンドのワークフロー性能推定値が得られた。
  • リソースタイプごとにモデルのトレーニングと推論を分離することで、スケーラブルで保守性の高い性能予測が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。