[論文レビュー] Detecting Anomalies in Software Execution Logs with Siamese Network
本稿では、正例と異常例のシーケンスを埋め込み空間内で類似するように学習する対照的学習を活用して、ソフトウェア実行ログにおける異常検出のためのシamese LSTMネットワークを提案する。HDFSログデータセットにおいて、最先端のF1スコア0.996を達成しており、訓練ペアを3000倍削減する独自のペア生成手法により、高い精度を維持しながら計算コストを大幅に削減した。さらに、人間が関与する分析を可能にする、非教師付きのログ進化モニタリングと可視化手法を導入した。
Logs are semi-structured text files that represent software's execution paths and states during its run-time. Therefore, detecting anomalies in software logs reflect anomalies in the software's execution path or state. So, it has become a notable concern in software engineering. We use LSTM like many prior works, and on top of LSTM, we propose a novel anomaly detection approach based on the Siamese network. This paper also provides an authentic validation of the approach on the Hadoop Distributed File System (HDFS) log dataset. To the best of our knowledge, the proposed approach outperforms other methods on the same dataset at the F1 score of 0.996, resulting in a new state-of-the-art performance on the dataset. Along with the primary method, we introduce a novel training pair generation algorithm that reduces generated training pairs by the factor of 3000 while maintaining the F1 score, merely a modest decay from 0.996 to 0.995. Additionally, we propose a hybrid model by combining the Siamese network with a traditional feedforward neural network to make end-to-end training possible, reducing engineering effort in setting up a deep-learning-based log anomaly detector. Furthermore, we examine our method's robustness to log evolutions by evaluating the model on synthetically evolved log sequences; we got the F1 score of 0.95 at the noise ratio of 20%. Finally, we dive deep into some of the side benefits of the Siamese network. Accordingly, we introduce a method of monitoring the evolutions of logs without label requirements at run-time. Additionally, we present a visualization technique that facilitates human administrations of log anomaly detection.
研究の動機と目的
- 異常がまれで非異常が大多数を占める、アンバランスなログ異常検出データセットの課題に対処すること。
- バランスの取れた訓練データを必要とせず、正常および異常ログシーケンスの両方を効果的に活用できる深層学習モデルの開発。
- 最適化されたペア生成アルゴリズムにより、シameseネットワークの訓練コストを低減すること。
- ソフトウェアの更新に伴うログの進化という、実環境システムで一般的な問題に対しても、異常検出の頑健性を確保すること。
- 人間が関与する分析を可能にする、ログ埋め込みの解釈可能な監視と可視化を提供すること。
提案手法
- 同じLSTMベースのエンコーダーを2つ用いたシameseネットワークアーキテクチャを採用し、ログシーケンスのペアを処理することで、共有の埋め込み空間を学習する。
- 同じクラスのシーケンス(正常-正常または異常-異常)の埋め込み間の距離を最小化し、異なるクラス間の距離を最大化するように、対照的損失を用いて学習する。
- 負例サンプリングにインspiredした独自のペア生成アルゴリズムにより、訓練ペアの数を3000倍削減しつつ、F1スコアを0.995に維持した。
- シameseネットワークとフィードフォワードニューラルネットワークを組み合わせたハイブリッドモデルにより、エンドツーエンドの学習を可能にし、工学的オーバーヘッドを低減した。
- 訓練データのガウス・ミックスチャネル・モデルに基づくログ尤度を測定することで、ログ進化を監視する非教師付きのフィットネススコアを導入した。
- 高次元埋め込みの可視化には、T-SNE、UMAP、PCAを用い、異常境界の人の理解を可能にした。
実験結果
リサーチクエスチョン
- RQ1HDFSデータセットにおいて、シameseネットワークベースのアプローチは、既存の最先端手法を上回る性能を示せるか?
- RQ2性能を損なわず、シameseネットワークの訓練効率をどのように向上できるか?
- RQ3ソフトウェアの更新に伴うログシーケンスの進化に対して、提案手法はどの程度頑健であるか?
- RQ4ラベルなしで、学習された埋め込み空間を用いてログ進化を検出できるか?
- RQ5埋め込み済みのログシーケンスの可視化により、異常検出の理解と人間による監視が向上するか?
主な発見
- 提案されたシameseネットワークは、HDFSログデータセットでF1スコア0.996を達成し、新たな最先端性能を樹立した。
- 独自のペア生成アルゴリズムにより、訓練ペアの数を3000倍削減したが、F1スコアは0.996から0.995へのわずかな低下にとどまった。
- モデルはログ進化に対しても強く頑健であり、合成的に進化させたログシーケンスで20%のノイズ比でもF1スコア0.95を達成した。
- フィットネススコア指標は、ラベルなしでログ進化を効果的に検出でき、生産環境でのプロアクティブな再訓練意思決定を可能にした。
- T-SNE、UMAP、PCAを用いた可視化により、埋め込み空間上で正常と異常のログシーケンスが明確に分離されており、モデルの識別能力を確認した。
- ハイブリッド型シamese-フィードフォワードモデルにより、エンドツーエンドの学習が可能になり、実用的導入が容易になった。シamese部がなければF1スコアは0.996から0.973に低下するなど、高い性能を達成する上で不可欠であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。