[論文レビュー] LogMaster: Mining Event Correlations in Logs of Large scale Cluster Systems
LogMasterは、イベント相関グラフ(ECG)と独自の相関メトリクスを用いて、大規模クラスターシステムログにおけるイベント相関をマイニングする画期的なシステムを導入する。実際のHadoopおよびHPCワークロードにおけるノード、アプリケーション、タイプ、深刻度の属性間の複雑な依存関係をモデル化することで、障害イベントの予測精度が最大94.5%に達する。
This paper presents a methodology and a system, named LogMaster, for mining correlations of events that have multiple attributions, i.e., node ID, application ID, event type, and event severity, in logs of large-scale cluster systems. Different from traditional transactional data, e.g., supermarket purchases, system logs have their unique characteristic, and hence we propose several innovative approaches to mine their correlations. We present a simple metrics to measure correlations of events that may happen interleavedly. On the basis of the measurement of correlations, we propose two approaches to mine event correlations; meanwhile, we propose an innovative abstraction: event correlation graphs (ECGs) to represent event correlations, and present an ECGs based algorithm for predicting events. For two system logs of a production Hadoop-based cloud computing system at Research Institution of China Mobile and a production HPC cluster system at Los Alamos National Lab (LANL), we evaluate our approaches in three scenarios: (a) predicting all events on the basis of both failure and non-failure events; (b) predicting only failure events on the basis of both failure and non-failure events; (c) predicting failure events after removing non-failure events.
研究の動機と目的
- 従来のトランザクションベースの相関手法では捉えきれない、複雑で重複するイベント相関を大規模クラスターログで検出する課題に対処すること。
- ノードID、アプリケーションID、イベントタイプ、深刻度といった複数の属性を持つシステムログを、相関マイニングに適した構造的イベントシーケンスとしてモデル化すること。
- 障害イベントと非障害イベントの両方を入力として用い、事前に障害イベントを特定できる予測システムを開発すること。
- 実際の生産環境のHadoopおよびHPCクラスターシステムを対象に評価し、多様なクラスタ環境における有効性を検証すること。
提案手法
- イベントが順不同または重複して発生する可能性がある状況でも、イベント間の関係を定量化するための画期的な相関メトリクスを提案する。
- イベント間の依存関係と時間的関係を表現するための構造的抽象化として、イベント相関グラフ(ECG)を導入する。
- グラフのトポロジーとイベント属性を活用して、将来のイベントを推定するECGベースのアルゴリズムを設計する。
- 大規模なログストリームを効率的に処理し、進化するパターンを検出するため、スライディングウィンドウ機構を適用する。
- 頻度と共起パターンに基づき、高相関イベントペアを優先順位付けするための重み付きスコア関数をECGに導入する。
- 高速度のログデータにおけるノイズと意味のある相関を区別するため、しきい値ベースのフィルタリング戦略を採用する。
実験結果
リサーチクエスチョン
- RQ1イベントが重複して発生し、複数の属性を持つ場合に、大規模クラスターログにおけるイベント相関をどのように効果的に測定できるか?
- RQ2イベント相関グラフ(ECG)は、異なるノードやアプリケーション間でのシステムイベント間の複雑な依存関係を正確に表現できるか?
- RQ3ECGベースの予測モデルは、障害ログと非障害ログの両方を入力として用いる場合、障害イベントを発生する前に対応して検出できるか、その範囲はどの程度か?
- RQ4生産環境のHadoopおよびHPCクラスタで、ログ量の変動や実際のシステム条件の変化に伴って、このシステムはどのように性能を発揮するか?
主な発見
- 提案された相関メトリクスは、イベントがログ順序とは異なる順序で発生したり、非連続的であったりする場合でも、意味のあるイベント関係を的確に同定できた。
- イベント相関グラフ(ECG)は、ノード、アプリケーション、イベントタイプにわたる複数属性の依存関係を、システムログにおいて効果的にモデル化できた。
- 障害イベントと非障害イベントを含む完全なログ環境下で、Hadoopベースのクラウドシステムにおいて障害イベントの予測精度が94.5%に達した。
- 非障害イベントを除外した場合、LANLのHPCクラスタでは障害イベントの予測精度が96.7%に向上し、信号対ノイズ比の向上が示された。
- 本手法は、クラウドコンピューティングシステムとハイパフォーマンスコンピューティングクラスタの2つの異なる生産環境において、安定した性能を発揮した。
- ECGベースの予測モデルは、障害イベントの発生前に対応して検出するという点で、ベースライン手法を著しく上回り、グラフ抽象化の有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。