Skip to main content
QUICK REVIEW

[論文レビュー] Tiresias: Online Anomaly Detection for Hierarchical Operational Network Data

Chi-Yao Hong, Matthew Caesar|arXiv (Cornell University)|Mar 9, 2012
Network Security and Intrusion Detection参考文献 16被引用数 6
ひとこと要約

Tiresias は、階層的運用ネットワークデータのオンライン異常検出システムであり、適応的階層的ヘビーホッターを用いて、高精度でリアルタイムに異常を検出する。実際のISPデータを用いた評価では、異常を特定する精度が94%以上に達した。

ABSTRACT

Operational network data, management data such as customer care call logs and equipment system logs, is a very important source of information for network operators to detect problems in their networks. Unfortunately, there is lack of efficient tools to automatically track and detect anomalous events on operational data, causing ISP operators to rely on manual inspection of this data. While anomaly detection has been widely studied in the context of network data, operational data presents several new challenges, including the volatility and sparseness of data, and the need to perform fast detection (complicating application of schemes that require offline processing or large/stable data sets to converge). To address these challenges, we propose Tiresias, an automated approach to locating anomalous events on hierarchical operational data. Tiresias leverages the hierarchical structure of operational data to identify high-impact aggregates (e.g., locations in the network, failure modes) likely to be associated with anomalous events. To accommodate different kinds of operational network data, Tiresias consists of an online detection algorithm with low time and space complexity, while preserving high detection accuracy. We present results from two case studies using operational data collected at a large commercial IP network operated by a Tier-1 ISP: customer care call logs and set-top box crash logs. By comparing with a reference set verified by the ISP's operational group, we validate that Tiresias can achieve >94% accuracy in locating anomalies. Tiresias also discovered several previously unknown anomalies in the ISP's customer care cases, demonstrating its effectiveness.

研究の動機と目的

  • 顧客ケアログやシステムクラッシュレポートなどの、スパarsity(スパarsity)、変動性、階層的構造を示す運用ネットワークデータにおける異常検出の課題に対処すること。
  • 大規模ネットワークにスケーラブルで、オフライン手法とは異なりリアルタイムで動作する、オンラインで低複雑性の検出システムを開発すること。
  • 運用データの階層的構造を活用して、リーフレベルの信号が希な場合でも、集約レベルで高影響度の異常を検出できること。
  • 動的でストリーミングな運用データに階層的ヘビーホッター検出を適応させることで、既存の異常検出技術を改善すること。
  • 実際のISP環境における既知および未知の異常を検出するシステムの有効性を検証すること。

提案手法

  • Tiresias は、ストリーミングデータに適応させた階層的ヘビーホッター検出に基づくオンライン検出アルゴリズムを用い、時間的・空間的複雑性が低い。
  • 複数の階層レベルにわたるヘビーホッターの追跡により、動的に高影響度の集約(例:ネットワーク位置、障害モード)を特定する。
  • 時間経過に伴いヘビーホッターの位置を適応的に調整する新規なスキームを採用し、トップレベルノード以下の細粒度での異常検出を可能にする。
  • 精度、再現率、F1スコアを算出するために、ISP運用から得た正解データセットと検出された異常を比較し、階層的マッチング関数を用いる。
  • 時間的および階層的関係に基づき、異常を真陽性、見逃された異常、新規異常、真陰性に分類するメカニズムを含む。
  • Tiresias はリアルタイムでデータを処理するため、迅速な応答が求められる緊急性の高い運用データに適している。

実験結果

リサーチクエスチョン

  • RQ1オンライン異常検出システムは、スパarsity(スパarsity)、変動性、階層的構造を示す運用ネットワークデータにおいて、効果的に異常を特定できるか?
  • RQ2オフライン手法と比較して、リアルタイムでストリーミング運用データに適応させた階層的ヘビーホッター検出は、どのような性能を示すか?
  • RQ3信号が弱い(例:最初のネットワークレベル未満の)細粒度のレベルで、Tiresias はどの程度異常を検出できるか?
  • RQ4Tiresias は、従来の監視手法や基準手法が捉えていなかった、以前に未知の異常を発見できるか?
  • RQ5実際のISP展開において、検出精度、計算効率、スケーラビリティのトレードオフはどのようになるか?

主な発見

  • ISP運用チームが検証した基準セットと比較して、Tiresias は94%以上の精度で異常の特定に成功した。
  • システムは大多数の既知の異常を検出できており、見逃された異常は少なく、真陽性および真陰性の割合が高かった。
  • Tiresias は、リファレンス手法が見逃した複数の以前に未知の異常を発見した。特に、VHO、CO、DSLAMなどの低い階層レベルで顕著であった。
  • 新規に発見された異常の95%がVHOレベル未満に局在しており、システムが微細で局所的な問題を検出できる能力を示している。
  • COレベルでの新規異常の検出割合は29.3%、DSLAMレベルでは9.4%であり、ネットワークエッジ部の検出能力が強いことを示している。
  • システムの適応的ヘビーホッター機構により、データが希だったり変動性が高かったりする状況でも正確な検出が可能であり、最初のレベル集約に限定された手法を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。