Skip to main content
QUICK REVIEW

[论文解读] Log-based Anomaly Detection based on EVT Theory with feedback

Jinyang Liu, Junjie Huang|arXiv (Cornell University)|Jun 8, 2023
Software System Performance and Reliability被引用 4
一句话总结

ScaleAD 是一种轻量级、自适应的基于日志的异常检测框架,采用基于Trie的检测代理(TDA)实现实时、低资源消耗的云系统异常检测。通过整合人工专家或大语言模型(LLMs)的反馈,即使日志模式持续演化,也能保持高检测准确率,相比基线方法实现2至10倍的推理速度提升,内存占用降低5%至41%。

ABSTRACT

System logs play a critical role in maintaining the reliability of software systems. Fruitful studies have explored automatic log-based anomaly detection and achieved notable accuracy on benchmark datasets. However, when applied to large-scale cloud systems, these solutions face limitations due to high resource consumption and lack of adaptability to evolving logs. In this paper, we present an accurate, lightweight, and adaptive log-based anomaly detection framework, referred to as SeaLog. Our method introduces a Trie-based Detection Agent (TDA) that employs a lightweight, dynamically-growing trie structure for real-time anomaly detection. To enhance TDA's accuracy in response to evolving log data, we enable it to receive feedback from experts. Interestingly, our findings suggest that contemporary large language models, such as ChatGPT, can provide feedback with a level of consistency comparable to human experts, which can potentially reduce manual verification efforts. We extensively evaluate SeaLog on two public datasets and an industrial dataset. The results show that SeaLog outperforms all baseline methods in terms of effectiveness, runs 2X to 10X faster and only consumes 5% to 41% of the memory resource.

研究动机与目标

  • 解决现有基于日志的异常检测方法在大规模云系统中的局限性,特别是高资源消耗和对演化日志适应性差的问题。
  • 设计一种在严格资源约束(如每实例仅1个CPU核心、200MB内存)下仍能保持高检测准确率的系统。
  • 实现在软件频繁更新导致日志模式持续演化的云环境中,对日志模式演化实现持续自适应,而无需从头重新训练。
  • 探索利用大语言模型(如ChatGPT)作为专家反馈源的可行性,以减少人工标注工作量。
  • 开发一种可扩展且高效的解决方案,适用于在数千个云实例中大规模部署。

提出的方法

  • 提出一种基于Trie的检测代理(TDA),利用轻量级、动态扩展的Trie结构,高效索引并实时检测异常日志模式。
  • 应用极值理论(EVT)建模日志频率的尾部分布,从而实现对罕见或异常日志事件的稳健检测。
  • 集成反馈循环,利用人工标注的异常日志持续优化TDA的检测逻辑,随时间推移逐步提升检测准确率。
  • 利用大语言模型(LLMs)作为自动化专家反馈源,评估日志语义相似性并验证异常预测结果。
  • 设计面向流式日志处理的系统架构,实现在云实例本地的低延迟、原地检测,无需依赖集中式计算。
  • 通过增量式Trie更新与EVT-based阈值设定,优化TDA的内存与计算资源使用,确保极低的资源开销。

实验结果

研究问题

  • RQ1轻量级、实例内部署的异常检测系统是否能在CPU和内存受限的真实云环境中实现高检测准确率?
  • RQ2与人工专家相比,利用LLMs(如ChatGPT)提供的反馈在提升异常检测准确率方面的有效性如何?
  • RQ3基于EVT的日志频率尾部分布建模在检测演化日志流中罕见或新型异常方面的增强效果有多大?
  • RQ4与现有基于机器学习和深度学习的异常检测方法相比,所提出的基于TDA的方法在处理速度与内存效率方面扩展性如何?
  • RQ5当日志模式随时间显著演化(如软件发布周期)时,系统是否仍能保持高性能?

主要发现

  • ScaleAD在两个公开数据集和华为云的工业数据集上,F1分数介于0.908至0.990之间,展现出极高的检测准确率。
  • 相比基线方法,框架的推理速度提升2至10倍,显著加快了实时日志处理的推理速度。
  • ScaleAD的内存占用仅为现有方法的5%至41%,使其适用于资源受限的云实例部署。
  • 来自ChatGPT等LLMs的反馈在异常检测一致性方面与人工专家相当,显著减少了对人工验证的需求。
  • 即使在日志模式显著演化的情况下,系统仍能保持高准确率——在20个微服务系统中,平均每月有14.5%的日志为新日志,且85%的日志对之间语义相似度较低。
  • TDA与反馈驱动自适应机制的结合,使系统在演化日志上保持持续高性能,优于静态模型及纯无监督深度学习方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。