Skip to main content
QUICK REVIEW

[论文解读] Log Message Anomaly Detection and Classification Using Auto-B/LSTM and Auto-GRU

Amir Farzad, T. Aaron Gulliver|arXiv (Cornell University)|Nov 20, 2019
Software System Performance and Reliability被引用 10
一句话总结

本文提出 Auto-LSTM、Auto-BLSTM 和 Auto-GRU 模型,通过将自编码器与循环神经网络结合,实现对日志消息的异常检测与分类。首先利用自编码器将非结构化日志数据压缩为有意义的特征,再通过 LSTM、BLSTM 或 GRU 进行序列建模,该方法在基准日志数据集上实现了超过 99% 的准确率、精确率与 F1 值,优于现有方法,且仅需极少的训练数据。

ABSTRACT

Log messages are now widely used in software systems. They are important for classification as millions of logs are generated each day. Most logs are unstructured which makes classification a challenge. In this paper, Deep Learning (DL) methods called Auto-LSTM, Auto-BLSTM and Auto-GRU are developed for anomaly detection and log classification. These models are used to convert unstructured log data to extracted features which is suitable for classification algorithms. They are evaluated using four data sets, namely BGL, Openstack, Thunderbird and IMDB. The first three are popular log data sets while the fourth is a movie review data set which is used for sentiment classification. The results obtained show that Auto-LSTM, Auto-BLSTM and Auto-GRU perform better than other well-known algorithms.

研究动机与目标

  • 为解决大规模软件系统生成的非结构化日志消息中异常检测的挑战。
  • 通过从原始非结构化日志文本中提取有意义的特征,提升日志分类性能。
  • 开发深度学习模型,仅需极少的训练数据即可在异常检测与分类任务中保持高准确率。
  • 在多样化的数据集(包括系统日志和情感标注文本)上评估所提模型,以证明其泛化能力。
  • 表明基于自编码器的特征提取可提升循环网络在序列日志数据上的性能。

提出的方法

  • 使用自编码器将原始日志消息压缩为低维潜在表示,以保留其结构与语义特征。
  • 将自编码器学习到的潜在特征输入至 LSTM、BLSTM 或 GRU 网络,用于序列建模与分类。
  • 使用词频将文本日志消息转换为数值向量,以在自编码器训练前保留基本的词级关系。
  • 采用端到端反向传播训练模型,自编码器部分使用重构损失,分类头部分使用交叉熵损失。
  • 采用 10 折交叉验证评估泛化能力,且训练数据限制在总数据集的 1% 以下。
  • 建议未来工作进行超参数调优,以进一步提升性能。

实验结果

研究问题

  • RQ1基于自编码器的特征提取是否能提升循环网络在日志异常检测与分类中的性能?
  • RQ2在日志数据集上,Auto-LSTM、Auto-BLSTM 和 Auto-GRU 与现有模型相比,在准确率、精确率、召回率与 F1 值方面表现如何?
  • RQ3这些模型在非日志文本分类任务(如情感分析)中的泛化能力如何?
  • RQ4当仅使用极小部分训练数据(少于 1%)并结合自编码器特征学习时,是否仍能保持高性能?
  • RQ5Auto-BLSTM 中的双向上下文相比单向 LSTM 与 GRU,在捕捉日志消息语义方面有何优势?

主要发现

  • Auto-BLSTM 模型在 BGL、OpenStack 和 Thunderbird 数据集上的平均验证准确率达到 99.6%,测试准确率达到 99.4%。
  • 在 BGL 数据集上,Auto-BLSTM 模型对正样本(异常日志)的召回率达到 99.9%,F1 值为 99.3%。
  • Auto-LSTM 模型测试准确率为 99.0%,对负样本和正样本的精确率与召回率分别为 98.4% 和 99.8%。
  • Auto-GRU 模型测试准确率为 99.2%,对负样本和正样本的精确率分别为 98.7% 和 99.9%,召回率分别为 99.9% 和 98.5%。
  • 所有模型均优于 IKNN 算法,在负样本日志上的精确率(98.7% vs. 96%)、召回率(99.9% vs. 96%)与 F1 值(99.1% vs. 96%)均更高。
  • 模型在 IMDB 电影评论数据集上也表现出色,实现了强大的情感分类性能,表明其在日志分析之外具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。