Skip to main content
QUICK REVIEW

[論文レビュー] LAnoBERT: System Log Anomaly Detection based on BERT Masked Language Model

Yukyung Lee, Jina Kim|arXiv (Cornell University)|Nov 18, 2021
Software System Performance and Reliability参考文献 32被引用数 10
ひとこと要約

LAnoBERT は、ログパーサーに依存せず、BERT のマスキング言語モデル(MLM)を用いて、ログパーサーを必要とせずに正常なログパターンを学習する、パーサー不要で教師なしのシステムログ異常検出手法を提案する。HDFS、BGL、Thunderbird データセットにおいて最先端の性能を達成し、教師なしモデルを上回り、教師ありベンチマークと同等の性能を発揮する。また、実世界の展開に適した効率的な推論が可能である。

ABSTRACT

The system log generated in a computer system refers to large-scale data that are collected simultaneously and used as the basic data for determining errors, intrusion and abnormal behaviors. The aim of system log anomaly detection is to promptly identify anomalies while minimizing human intervention, which is a critical problem in the industry. Previous studies performed anomaly detection through algorithms after converting various forms of log data into a standardized template using a parser. Particularly, a template corresponding to a specific event should be defined in advance for all the log data using which the information within the log key may get lost. In this study, we propose LAnoBERT, a parser free system log anomaly detection method that uses the BERT model, exhibiting excellent natural language processing performance. The proposed method, LAnoBERT, learns the model through masked language modeling, which is a BERT-based pre-training method, and proceeds with unsupervised learning-based anomaly detection using the masked language modeling loss function per log key during the test process. In addition, we also propose an efficient inference process to establish a practically applicable pipeline to the actual system. Experiments on three well-known log datasets, i.e., HDFS, BGL, and Thunderbird, show that not only did LAnoBERT yield a higher anomaly detection performance compared to unsupervised learning-based benchmark models, but also it resulted in a comparable performance with supervised learning-based benchmark models.

研究の動機と目的

  • ログパーサー依存のログ異常検出手法が情報損失のリスクを伴い、専門家のテンプレートに依存するという限界を是正すること。
  • ログパーサーによる前処理を経ずに、生のログシーケンスから直接正常なログパターンを学習する、耐障害性の高い教師なし異常検出フレームワークの開発。
  • BERT で微調整した文脈を考慮した埋め込みを活用することで、マスキング言語モデルを用いてログデータ上で学習した、異常検出性能の向上。
  • リアルタイムのシステム監視に適した効率的な推論パイプラインを提供することで、実用的展開を可能にすること。
  • 自然言語に類似した構造を有するさまざまな複雑さのログデータに対して、事前学習された BERT の有効性を検証すること。

提案手法

  • LAnoBERT は、マスキング言語モデル(MLM)を用いて、ログシーケンスから完全に事前学習された BERT アーキテクチャを採用し、正常なログパターンの文脈的表現を学習する。
  • モデルは、正規表現に基づく前処理と WordPiece タイクニングを経て、生のログキーワードを処理し、ログパーサーに依存しない。
  • 推論時、異常スコアは MLM の予測損失と上位 k 個の予測確率に基づいて計算され、損失が大きいほど異常性が高いと判断される。
  • 異常は、予測されたトークン確率が正常パターンからどれほど逸脱しているかを測定することで検出され、上位 k 個の確率スコアにしきい値を適用する。
  • シーケンス埋め込みのキャッシュとアテンションパターンの再利用により、効率的な推論が可能となり、リアルタイム展開が実現される。
  • モデルは、MLM 目的関数を用いてログデータ上で微調整され、訓練には正常ログのみを用いた教師なし設定で性能が評価される。
Figure 1: The architecture of LAnoBERT.
Figure 1: The architecture of LAnoBERT.

実験結果

リサーチクエスチョン

  • RQ1マスキング言語モデルで学習された BERT ベースのモデルは、ログパーサーを必要とせずに、システムログの異常を効果的に検出できるか?
  • RQ2LAnoBERT の性能は、標準ベンチマークデータセットにおける教師なしおよび教師ありのログ異常検出ベースラインと比較してどうなるか?
  • RQ3自然言語コーパス上で事前学習した BERT は、語彙が少なく構造が単純なログデータにおいて、性能を向上させるか、悪化させるか?
  • RQ4教師なしでパーサーに依存しないアプローチは、実世界のログ異常検出シナリオで、教師ありモデルと同等の性能を達成できるか?
  • RQ5BERT ベースの異常検出を実用的な生産システムに適した効率的な推論パイプラインとして設計するにはどうすればよいか?

主な発見

  • LAnoBERT は、HDFS、BGL、Thunderbird データセットのすべての教師なしベンチマークモデルを上回り、各データセットで最高の F1 スコアを達成した。
  • BGL データセットでは、事前学習済み BERT モデルを用いた場合、F1 スコアが 0.9020 に達し、初期学習から開始したバージョンより 0.0271 の向上を示した。
  • HDFS データセットでは、初期学習から微調整した場合の F1 スコアは 0.9304 であり、事前学習済み BERT バージョンを 0.0341 上回った。これは、非常に単純なログ構造では事前学習が性能に悪影響を及える可能性があることを示唆している。
  • 結果から、事前学習 BERT は、語彙数が十分に多い(例:1,000 個以上)、BGL のような言語的複雑性を有するログデータでは有効であるが、HDFS のような最小構造のデータセットでは有効でないことが示唆された。
  • LAnoBERT は、教師あり学習ベースのモデルと同等の性能を達成した。これは、MLM を用いた教師なし事前学習が、異常検出において教師あり手法と同等の性能を発揮できることを示している。
  • 提案された効率的な推論パイプラインにより、リアルタイム展開が可能となり、実用的なシステム監視に適したモデルであることが示された。
Figure 2: Anomaly score distribution difference between normal and abnormal log sequences.
Figure 2: Anomaly score distribution difference between normal and abnormal log sequences.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。