Skip to main content
QUICK REVIEW

[论文解读] LogStamp: Automatic Online Log Parsing Based on Sequence Labelling

Shimin Tao, Weibin Meng|arXiv (Cornell University)|Aug 10, 2022
Software System Performance and Reliability被引用 4
一句话总结

LogStamp 是一种在线日志解析方法,通过使用 BERT 和标记器将日志解析问题建模为序列标注任务,实现仅需少量训练数据即可获得高精度解析。其在仅使用 10% 训练数据的情况下,平均准确率达到 0.956,适用于对新型或不断演化的系统日志进行实时分析。

ABSTRACT

Logs are one of the most critical data for service management. It contains rich runtime information for both services and users. Since size of logs are often enormous in size and have free handwritten constructions, a typical log-based analysis needs to parse logs into structured format first. However, we observe that most existing log parsing methods cannot parse logs online, which is essential for online services. In this paper, we present an automatic online log parsing method, name as LogStamp. We extensively evaluate LogStamp on five public datasets to demonstrate the effectiveness of our proposed method. The experiments show that our proposed method can achieve high accuracy with only a small portion of the training set. For example, it can achieve an average accuracy of 0.956 when using only 10% of the data training.

研究动机与目标

  • 解决在动态生产环境中持续出现新型日志类型时的在线日志解析挑战。
  • 克服现有日志解析方法依赖大量历史日志数据才能实现高精度的局限性。
  • 通过利用序列标注和预训练语言模型,实现在历史日志有限的新服务中实时、高精度的日志解析。
  • 确保在结构和词汇差异较大的多样化日志数据集上具备稳健性能,尤其在低数据条件下。

提出的方法

  • 将日志解析转化为序列标注问题,其中日志中的每个标记被标注为模板部分或变量占位符。
  • 利用 BERT 对日志序列的上下文表示进行编码,捕捉语义和句法模式,以提升模板识别能力。
  • 在 BERT 编码的嵌入表示上训练序列标记器(如 LSTM),以预测日志行中每个标记的标签。
  • 通过顺序处理日志实现在线解析,支持实时模板提取,无需批量处理。
  • 在日志特定数据上微调 BERT,以提升与日志语言模式的对齐性,尽管实验表明在此设置下收益有限。
  • 采用两阶段流程:先在标注的日志序列上进行离线预训练以学习模板模式,随后进行在线推理以实现实时解析。

实验结果

研究问题

  • RQ1LogStamp 是否能在仅使用少量训练数据的情况下实现在在线日志解析中的高精度?
  • RQ2LogStamp 在不同规模的训练数据下性能是否稳定,尤其是在仅使用 10% 数据集的情况下?
  • RQ3BERT 和序列标记器(如 LSTM、CNN)对整体解析精度的贡献如何?
  • RQ4在公开数据集上,LogStamp 与现有日志解析方法在精度和可扩展性方面相比如何?

主要发现

  • 当在五个公开数据集上仅使用 10% 的训练数据进行训练时,LogStamp 的平均解析准确率达到 0.956。
  • 该模型在所有五个数据集上均保持高度稳定和准确,即使在小规模训练集下,其在线准确率也始终高于 0.95。
  • 基于 LSTM 的标记器在序列标注中表现优于 GCN、RNN 和 CNN,在所有数据集上均达到最高准确率。
  • BERT-base、BERT-small 和 BERT-tiny 表现相当,表明在此设置下模型大小对准确率影响不显著。
  • 该模型展现出强大的泛化能力,在 Hadoop 和 BGL 数据集上的在线准确率即使在数据极少的情况下也超过 0.997。
  • 在日志数据上微调 BERT 并未带来聚类或解析性能的一致性提升,表明预训练 BERT 已经充分捕捉了该任务所需的日志语义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。