Skip to main content
QUICK REVIEW

[論文レビュー] A Comprehensive Study of Machine Learning Techniques for Log-Based Anomaly Detection

Shan E Ali, Chaima Boufaied|arXiv (Cornell University)|Jul 31, 2023
Software System Performance and ReliabilityComputer Science被引用数 3
ひとこと要約

本論文は、ログベース異常検出(LAD)における教師ありおよび半教師ありの従来的手法およびディープラーニング手法を包括的に比較する実証的調査を提示している。検出精度、時間パフォーマンス、ハイパーパramータチューニングへの感受性の観点から評価されている。結果として、教師あり従来手法、特にランダムフォレストが、精度、速度、ハイパーパramータの変化に対するロバストネスにおいてディープラーニング手法を上回っていることが示された。一方、半教師あり手法は顕著に低い検出精度を示した。

ABSTRACT

Growth in system complexity increases the need for automated log analysis techniques, such as Log-based Anomaly Detection (LAD). While deep learning (DL) methods have been widely used for LAD, traditional machine learning (ML) techniques can also perform well depending on the context and dataset. Semi-supervised techniques deserve the same attention as they offer practical advantages over fully supervised methods. Current evaluations mainly focus on detection accuracy, but this alone is insufficient to determine the suitability of a technique for a given LAD task. Other aspects to consider include training and prediction times as well as the sensitivity to hyperparameter tuning, which in practice matters to engineers. This paper presents a comprehensive empirical study evaluating a wide range of supervised and semi-supervised, traditional and deep ML techniques across four criteria: detection accuracy, time performance, and sensitivity to hyperparameter tuning in both detection accuracy and time performance. The experimental results show that supervised traditional and deep ML techniques fare similarly in terms of their detection accuracy and prediction time on most of the benchmark datasets considered in our study. Moreover, overall, sensitivity analysis to hyperparameter tuning with respect to detection accuracy shows that supervised traditional ML techniques are less sensitive than deep learning techniques. Further, semi-supervised techniques yield significantly worse detection accuracy than supervised techniques.

研究の動機と目的

  • 検出精度以外の観点からも、ログベース異常検出(LAD)における従来的手法およびディープラーニング手法を体系的に評価すること。
  • ハイパーパramータチューニングが、さまざまな機械学習手法における検出精度および時間パフォーマンスに与える影響を評価すること。
  • 実世界のベンチマークデータセットを用いて、教師ありおよび半教師ありアプローチ、ならびに従来的手法およびディープラーニングモデルを比較すること。
  • 精度、効率性、ハイパーパramータへの感受性の観点から、LADにおける最適な機械学習手法の選定に関する実用的指針を提供すること。

提案手法

  • 本研究では、4つの教師あり手法(SVM、ランダムフォレスト、LSTM、LogRobust)と2つの半教師あり手法(OC-SVM、DeepLog)を、2つのベンチマークデータセット(HDFS および Hadoop)で評価した。
  • ログパースにはDrainが用いられ、ログテンプレートが抽出され、固定ウィンドウまたはスライディングウィンドウにグループ化されてテンプレートシーケンスが形成された。
  • 特徴量抽出には、インデックスベースのエンコーディング(DeepLog用)または意味的ベクトル化(例:FastText、word2vec with PPA)が用いられ、ログシーケンスが表現された。
  • モデルの学習と予測は、複数の設定において、検出精度、学習時間、予測時間、ハイパーパramータチューニングへの感受性の観点から評価された。
  • ハイパーパramータチューニングは、すべての手法に対して体系的に行われ、感受性は異なる設定におけるパフォーマンスの分散として測定された。
  • 実験は、2つの広く使われている公開データセット(HDFS および Hadoop)を用いて実施され、各データセットごとおよび手法間で結果が分析された。

実験結果

リサーチクエスチョン

  • RQ1RQ1: LADにおける教師あり従来手法およびディープラーニング手法の検出精度および時間パフォーマンスは、どのように比較されるか?
  • RQ2RQ2: さまざまな機械学習手法における検出精度および時間パフォーマンスは、ハイパーパramータチューニングに対してどの程度感受性を示すか?
  • RQ3RQ3: 検出精度およびパフォーマンス指標において、半教師あり手法は教師あり手法と比べてどのように比較されるか?
  • RQ4RQ4: さまざまなデータセットにおいて、精度、効率性、ハイパーパramータの変化に対する感受性のバランスが最も優れている機械学習手法はどれか?

主な発見

  • 教師あり従来手法およびディープラーニング手法は、検出精度および予測時間においてほぼ同一の水準に達しており、両者の間には顕著な性能差は認められなかった。
  • ランダムフォレストは、HDFSおよびHadoopの両データセットにおいて、検出精度および時間パフォーマンスの両面で、ハイパーパramータチューニングへの感受性が最も低かった。
  • SVM やランダムフォレストなどの教師あり従来モデルは、LSTM や LogRobust などのディープラーニングモデルと比較して、顕著に低い学習時間および予測時間を示した。
  • 半教師あり手法(OC-SVM および DeepLog)は、データセットやモデルタイプにかかわらず、教師あり手法に比べて顕著に低い検出精度を示した。
  • HDFS では DeepLog が学習時間のハイパーパramータチューニングに対して高い感受性を示したが、Hadoop では OC-SVM が低い感受性を示した。これは、データセット依存の挙動を示している。
  • Hadoop では、OC-SVM が検出精度、学習時間、ハイパーパramータへの感受性のすべての面で DeepLog を上回った。一方、HDFS では DeepLog がより高い精度と速度、低い感受性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。