[論文レビュー] Log Message Anomaly Detection and Classification Using Auto-B/LSTM and Auto-GRU
本論文では、自己符号化器と再帰的ネットワークを組み合わせて異常検出およびログメッセージ分類を実行する Auto-LSTM、Auto-BLSTM、Auto-GRU モデルを提案する。まず自己符号化器を用いて非構造化ログデータを意味のある特徴に圧縮し、その後に LSTM、BLSTM、または GRU を用いて系列モデリングを行うことで、ベンチマークログデータセット上で 99% を超える精度、適合率、F1スコアを達成し、最小限の学習データで既存手法を上回る性能を発揮する。
Log messages are now widely used in software systems. They are important for classification as millions of logs are generated each day. Most logs are unstructured which makes classification a challenge. In this paper, Deep Learning (DL) methods called Auto-LSTM, Auto-BLSTM and Auto-GRU are developed for anomaly detection and log classification. These models are used to convert unstructured log data to extracted features which is suitable for classification algorithms. They are evaluated using four data sets, namely BGL, Openstack, Thunderbird and IMDB. The first three are popular log data sets while the fourth is a movie review data set which is used for sentiment classification. The results obtained show that Auto-LSTM, Auto-BLSTM and Auto-GRU perform better than other well-known algorithms.
研究の動機と目的
- 大規模なソフトウェアシステムが生成する非構造化ログメッセージにおける異常検出の課題に対処すること。
- 生の非構造化ログテキストから意味のある特徴を抽出することで、ログ分類性能を向上させること。
- 最小限の学習データで高精度な異常検出および分類を維持できる深層学習モデルの開発。
- システムログおよびセンチメントラベル付きテキストを含む多様なデータセット上で提案モデルを評価し、汎化能力を示すこと。
- 自己符号化器に基づく特徴抽出が、系列的ログデータにおける再帰的ネットワークの性能向上に寄与することを示すこと。
提案手法
- 自己符号化器を用いて、生のログメッセージを構造的および意味的特徴を保持した低次元の潜在表現に圧縮する。
- 自己符号化器から学習された潜在特徴を、LSTM、BLSTM、または GRU ネットワークに供給し、系列モデリングおよび分類を実行する。
- テキストログメッセージを数値ベクトルに変換する際に、単語頻度を用いることで、基本的な語レベルの関係を保持する。
- 自己符号化器の再構成損失と分類ヘッドの交差エントロピー損失を用いて、バックプロパゲーションによるエンドツーエンドの学習を実行する。
- 汎化性能の評価のため、学習データを総データの 1% 未満に制限した 10-fold 交差検証を適用する。
- 将来的なステップとして、ハイパーパramータチューニングによるさらなる性能向上が提案される。
実験結果
リサーチクエスチョン
- RQ1自己符号化器に基づく特徴抽出は、ログ異常検出および分類における再帰的ネットワークの性能向上に寄与するか?
- RQ2Auto-LSTM、Auto-BLSTM、Auto-GRU は、既存のモデルと比較して、ログデータセットにおける精度、適合率、再現率、F1スコアの観点でどのように差をつけるか?
- RQ3これらのモデルは、センチメント分析のような非ログテキスト分類タスクへどの程度一般化可能か?
- RQ41% 未満の少数学習データを用いても、自己符号化器特徴学習と組み合わせることで高い性能が得られるか?
- RQ5Auto-BLSTM の双方向コンテキストは、単方向の LSTM や GRU と比較して、ログメッセージの意味をどの程度効果的に捉えられるか?
主な発見
- Auto-BLSTM モデルは、BGL、OpenStack、Thunderbird データセット全体で平均検証精度 99.6%、テスト精度 99.4% を達成した。
- BGL データセットでは、正例(異常ログ)の再現率が 99.9%、F1スコアが 99.3% を達成した。
- Auto-LSTM モデルは、テスト精度 99.0% を達成し、負例ログでは適合率 98.4%、正例ログでは再現率 99.8% を示した。
- Auto-GRU モデルは、テスト精度 99.2% を達成し、負例ログでは適合率 98.7%、再現率 99.9%、正例ログでは適合率 99.9%、再現率 98.5% を示した。
- すべてのモデルが IKNN アルゴリズムを上回り、負例ログにおいて適合率(98.7% 対 96%)、再現率(99.9% 対 96%)、F1スコア(99.1% 対 96%)が向上した。
- IMDB ムービー・レビュー・データセットに対しても、感情分類タスクで優れた性能を発揮し、ログ解析を越えた広範な適用可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。