Skip to main content
QUICK REVIEW

[論文レビュー] Flow-Bench: A Dataset for Computational Workflow Anomaly Detection

George Papadimitriou, Hongwei Jin|arXiv (Cornell University)|Jun 16, 2023
Scientific Computing and Data ManagementDecision Sciences被引用数 3
ひとこと要約

本稿では、分散HPCシステム上で実行される実際のワークフローに合成された異常を注入することで作成された、計算ワークフローの異常検出のための新規ベンチマークデータセット「Flow-Bench」を紹介する。本研究では、テーブル形式およびグラフ構造のワークフローデータに対して非教師あり機械学習手法を評価し、一部の手法は中程度の性能(例:F1スコア最大0.663)を達成するが、多くの手法はメモリ不足や精度の低さにより失敗することが判明し、科学的ワークフローにおける分野特化型の異常検出アプローチの必要性が浮き彫りになった。

ABSTRACT

A computational workflow, also known as workflow, consists of tasks that must be executed in a specific order to attain a specific goal. Often, in fields such as biology, chemistry, physics, and data science, among others, these workflows are complex and are executed in large-scale, distributed, and heterogeneous computing environments prone to failures and performance degradation. Therefore, anomaly detection for workflows is an important paradigm that aims to identify unexpected behavior or errors in workflow execution. This crucial task to improve the reliability of workflow executions can be further assisted by machine learning-based techniques. However, such application is limited, in large part, due to the lack of open datasets and benchmarking. To address this gap, we make the following contributions in this paper: (1) we systematically inject anomalies and collect raw execution logs from workflows executing on distributed infrastructures; (2) we summarize the statistics of new datasets, and provide insightful analyses; (3) we convert workflows into tabular, graph and text data, and benchmark with supervised and unsupervised anomaly detection techniques correspondingly. The presented dataset and benchmarks allow examining the effectiveness and efficiency of scientific computational workflows and identifying potential research opportunities for improvement and generalization. The dataset and benchmark code are publicly available \url{https://poseidon-workflows.github.io/FlowBench/} under the MIT License.

研究の動機と目的

  • 計算ワークフローにおける異常検出を評価するためのオープンで標準化されたベンチマークデータセットの不足に対処すること。
  • 実際の科学的およびデータサイエンスワークフローに合成故障を注入することで、現実的で多様なワークフローアニーリーのデータを生成すること。
  • ワークフローのテーブル形式およびグラフ構造の両方の表現に対して、最先端の非教師あり異常検出手法の性能を評価すること。
  • 大規模で複雑なワークフローに適用した場合に、既存の異常検出手法に見られる限界やスケーラビリティの問題を特定すること。
  • 再現可能な研究および今後のワークフローアニーリー検出分野の発展を可能にするために、公開され、MITライセンスで提供されるデータセットとコードベースを提供すること。

提案手法

  • 分散HPCインfraストラクチャ上で実行される実世界の科学的およびデータサイエンスワークフローに、タスク遅延、障害、リソース過負荷などの異常を体系的に注入する。
  • USC、ANL、RENCI、ORNLのシステムを含む、異種で大規模な計算環境で実行されたワークフローから生の実行ログを収集する。
  • ワークフローデータをテーブル形式およびグラフ構造の両方に変換し、依存関係を有向無閉路グラフ(DAG)としてモデル化することで、グラフベースの異常検出を可能にする。
  • PyODやPyGODの手法を含む15種類の最先端の非教師あり異常検出手法を、得られたデータセット上でベンチマークテストする。
  • 標準指標(AUC-ROC、F1スコア、top-k精度、メモリ効率(例:メモリ不足エラー))を用いて手法を評価する。
  • 新しいデータセットおよび既存のオープンデータセットの包括的な統計要約を提供し、比較分析および手法開発を支援する。

実験結果

リサーチクエスチョン

  • RQ1合成異常を含む実際の計算ワークフローに適用した場合、既存の非教師あり異常検出手法の有効性はいかほどか?
  • RQ2大規模なワークフローデータに対して、現在の異常検出手法に見られるスケーラビリティおよびメモリ効率の限界は何か?
  • RQ3F1スコアやAUC-ROCといった性能指標は、シミュレーション、データ分析、機械学習などの異なるワークフロー種別でどのように変化するか?
  • RQ4グラフベースの表現とテーブルベースの表現のどちらが、異常検出性能を向上させるか?
  • RQ5提案されたベンチマークデータセットは、科学的ワークフロー向けにより強固で汎用性の高い異常検出モデルの開発を支援できるか?

主な発見

  • LOF や OCSVM などの標準的な異常検出手法は、中程度のサイズのワークフローデータですらメモリ不足(OOM)エラーを発生させ、スケーラビリティの問題が顕在化している。
  • 最も高い性能を示した手法であるKNNは、データサイエンスワークフローでF1スコア0.663を達成したが、LOF や INNE などの他の手法はF1スコアが0.10未満にとどまり、検出性能が著しく低いことが判明した。
  • GNN などのグラフベース手法は有望ではあるが、一部のテーブルベース手法に劣っており、単にグラフ構造があるだけでは効果的な異常検出に十分でないことが示唆された。
  • LMDD手法はタイムアウトエラー(TLE)により失敗し、実世界の計算制約下での特定のアルゴリズムの不安定性が浮き彫りになった。
  • データセットには著しいクラス不均衡が存在し、正常インスタンスが異常インスタンスを大幅に上回っているため、非教師ありモデルの一般化に課題が生じる。
  • 生ログデータには、NLPベースのモデルが活用できる豊富な文脈的情報が含まれており、今後の研究においてグラフおよびテーブル表現を超えたアプローチの可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。