Skip to main content
QUICK REVIEW

[論文レビュー] Exathlon: A Benchmark for Explainable Anomaly Detection over Time Series

Vincent Jacob, Fei Song|arXiv (Cornell University)|Oct 10, 2020
Anomaly Detection Techniques and Applications参考文献 74被引用数 13
ひとこと要約

Exathlon は、6 種類の異常事象を含む 100 件以上の異常を含む実際の Apache Spark クラスターログから構築された、高次元時系列における説明可能な異常検出のための公開ベンチマークである。標準化されたパイプラインを通じて異常検出および説明技術の評価を可能にし、既存手法の限界を明らかにするとともに、スケーラブルで正確かつ一貫性のある説明フレームワークの必要性を強調する。

ABSTRACT

Access to high-quality data repositories and benchmarks have been instrumental in advancing the state of the art in many experimental research domains. While advanced analytics tasks over time series data have been gaining lots of attention, lack of such community resources severely limits scientific progress. In this paper, we present Exathlon, the first comprehensive public benchmark for explainable anomaly detection over high-dimensional time series data. Exathlon has been systematically constructed based on real data traces from repeated executions of large-scale stream processing jobs on an Apache Spark cluster. Some of these executions were intentionally disturbed by introducing instances of six different types of anomalous events (e.g., misbehaving inputs, resource contention, process failures). For each of the anomaly instances, ground truth labels for the root cause interval as well as those for the extended effect interval are provided, supporting the development and evaluation of a wide range of anomaly detection (AD) and explanation discovery (ED) tasks. We demonstrate the practical utility of Exathlon's dataset, evaluation methodology, and end-to-end data science pipeline design through an experimental study with three state-of-the-art AD and ED techniques.

研究の動機と目的

  • 高次元時系列における説明可能な異常検出(AD)のための標準化されたベンチマークの欠如が、再現可能性の高い研究と進展を妨げているという問題に対処する。
  • 意図的な異常を含む実際の分散ストリーミングワークロードから派生する包括的なデータセットを提供する。
  • AD および説明発見(ED)の両タスクにおける機能性(正確性、簡潔性、一貫性)と計算効率を測定する統一された評価手法を設計する。
  • 整理されたデータ、評価基準、再現性のある実験に適したスケーラブルなインfra を用いて、AD および ED パイプラインのエンドツーエンドのベンチマークを可能にする。
  • 最先端の AD および ED 技術の比較分析を促進し、現在のアプローチの限界を明らかにするとともに、今後の研究を導く。

提案手法

  • 2.5 ヵ月にわたり、10 種類の分散 Spark ストリーミングジョブを 100 件以上繰り返し実行し、リアルタイムのテレメトリを収集。6 種類の注入異常(例:不正な入力、リソース競合、プロセス障害)を含む。
  • 各異常を2つの期間でラベル付け:障害発生の根本原因期間(故障が発生した時期)と拡張効果期間(症状が観察された時期)。
  • 範囲ベースの正確性フレームワーク(Tatbul et al., 2018)を実装し、4 種類の設定で異常検出を評価:異常の存在、範囲検出、早期検出、正確に1回の検出。
  • 説明発見(ED)の評価には、3 つの基準(簡潔性、一貫性、正確性)を用い、局所的およびグローバルな説明それぞれに別個の指標を設定。
  • 生トレースを AD および ED の結果に変換するエンドツーエンドのデータサイエンスパイプラインを設計。データ前処理、モデル学習、推論、ベンチマークスコアリングを含む。
  • 実行時間などの計算効率指標を統合し、データ次元数やサンプリングレートの変化に応じたスケーラビリティを評価。

実験結果

リサーチクエスチョン

  • RQ1最先端の異常検出手法は、多様な異常タイプと実世界のノイズを含む現実的で高次元の時系列ベンチマーク上で、どの程度の性能を発揮するか?
  • RQ2既存の説明発見技術は、異常原因を特定するにあたり、どの程度の簡潔性、一貫性、正確性を達成しているか?
  • RQ3ストリーミング環境において、説明の質(正確性、安定性)と計算効率の間にはどのようなトレードオフがあるか?
  • RQ4モデル依存型とモデルフリー型の説明技術は、異なる異常タイプにおいて因果関係をどの程度正しく捉えられるか?
  • RQ5このベンチマークは、生産ワークロードにスケーラブルな統合型の異常および説明発見システムの開発を可能にするか?

主な発見

  • EXstream は、マージン的に関連の薄い特徴をヒューリスティックでプルーニングするため、LIME や MacroBase よりも説明の簡潔さと安定性が高く、類似した異常タイプ間で最高の一致度を達成した。
  • LIME は、平均して最大 245 秒にわたる実行時間を要し、低レイテンシのストリーミング処理ワークロードには不適切な、最も長く不安定な説明を生成した。
  • MacroBase は、多数の特徴組み合わせを評価することで、EXstream よりも局所的説明の正確性が高かったが、文脈依存の述語による一般化性の欠如が問題となった。
  • すべての ED 手法において、グローバルな説明の正確性が低下しており、特に異なる入力レートやシステムコンテキストで異常を説明する際、顕著であった。これは、文脈に依存しない時系列的説明の必要性を示唆する。
  • EXstream は、説明生成に約 0.01 秒という最速の速度を達成し、MacroBase(0.2–9 秒)や LIME(4 分以上)を大きく上回り、リアルタイムシステムへの適性が顕著に示された。
  • ベンチマークにより、既存の AD モデルがノイズの多い学習データや混合された異常タイプの下で、特に再検出率と早期検出において困難を抱えていることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。