[論文レビュー] Experience Report: Deep Learning-based System Log Analysis for Anomaly Detection
この論文は六つの DLベースのログ異常検知器(四つは教師なし、二つは教師あり)を調査・ベンチマークし、二つの公開データセット(HDFS、BGL)を用い、オープンソースのツールキットを公開し、精度・頑健性・効率を分析する。監督学習法は一般に教師なし法よりも優れており、ログの意味情報は性能を向上させる。
Logs have been an imperative resource to ensure the reliability and continuity of many software systems, especially large-scale distributed systems. They faithfully record runtime information to facilitate system troubleshooting and behavior understanding. Due to the large scale and complexity of modern software systems, the volume of logs has reached an unprecedented level. Consequently, for log-based anomaly detection, conventional manual inspection methods or even traditional machine learning-based methods become impractical, which serve as a catalyst for the rapid development of deep learning-based solutions. However, there is currently a lack of rigorous comparison among the representative log-based anomaly detectors that resort to neural networks. Moreover, the re-implementation process demands non-trivial efforts, and bias can be easily introduced. To better understand the characteristics of different anomaly detectors, in this paper, we provide a comprehensive review and evaluation of five popular neural networks used by six state-of-the-art methods. Particularly, four of the selected methods are unsupervised, and the remaining two are supervised. These methods are evaluated with two publicly available log datasets, which contain nearly 16 million log messages and 0.4 million anomaly instances in total. We believe our work can serve as a basis in this field and contribute to future academic research and industrial applications.
研究の動機と目的
- 現代のソフトウェアシステムの規模と複雑さに対処するため、 DLベースのログ異常検知の必要性を動機付ける。
- 代表的なニューラルネットワークベースの検知モデル(六つの手法にわたる五つのモデル)を網羅的に比較する。
- 産業界と研究における導入と再現性を容易にするオープンソースツールキットを提供する。
- accuracy、robustness、efficiency の観点から、従来の ML ベースラインと DLベース検知器をベンチマークする。
提案手法
- 六つの DLベースのログ異常検知器を検討・分類する(四つは教師なし、二つは教師あり)。
- 損失関数を予測、再構成、または教師ありの目的として定式化し、モデル学習を誘導する。
- ログ解析とログ埋め込みを適用して半構造化ログを DL モデル用の系列へ変換する。
- 二つの公開データセット(HDFSとBGL)で精度、再現率、F1を指標として評価する。
- 六つの手法を再利用可能とする PyTorchベースのオープンソースツールキットを提供する。
実験結果
リサーチクエスチョン
- RQ1 DLベースのログ異常検知器は標準的なログデータセットでどの程度の精度・頑健性・効率を示すか?
- RQ2 ログの意味情報を取り入れることは検知器の性能にどのような影響を与えるか?
- RQ3 実務でのロギング検知において、教師ありと教師なしの DL 手法は実践的にどう比較されるか?
- RQ4 学習データの異常比率が検知器の性能に与える影響はどの程度か?
主な発見
- 教師あり DL法は通常、教師なし法よりも両データセットで優れている(例:教師あり法の F1 は約0.97〜0.98)。
- 非意味情報設定では、unsupervised LSTM が HDFS で F1 0.944、BGL で 0.961 を達成。
- ログの意味情報を取り入れると多くのモデルの性能が向上;意味情報ありで最良の F1 は BGL で無意味設定時 CNN が 0.989、LSTM が 0.967 に達した。
- ログの意味論は特に Unsup. 法(Autoencoder や LSTM を含む)に有利で、顕著な改善が見られる(例:Autoencoder はいくつかの設定で F1 を約15%向上)。
- 従来の ML ベースラインと比較して、DLベースの手法は一般に高性能であり、両データセットでいくつかの従来法が DL アプローチを下回る。
- オープンソースツールキット(deep-loglizer)は、六つの検知器の再利用と再現性を促進するために提供されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。