Skip to main content
QUICK REVIEW

[论文解读] Kernel Based Sequential Data Anomaly Detection in Business Process Event Logs

Ashish Sureka|arXiv (Cornell University)|Jul 5, 2015
Business Process Modeling and Analysis参考文献 5被引用 10
一句话总结

本文提出了一种基于核函数的无监督异常检测方法,用于业务流程事件日志,利用k近邻(kNN)和归一化最长公共子序列(nLCS)相似度来识别序列化流程轨迹中的异常值。在真实世界的事后管理数据集上进行评估,该方法以高精度有效检测出异常案例,表明基于核函数的序列建模在流程挖掘中的异常检测方面优于传统方法。

ABSTRACT

Business Process Management Systems (BPMS) log events and traces of activities during the execution of a process. Anomalies are defined as deviation or departure from the normal or common order. Anomaly detection in business process logs has several applications such as fraud detection and understanding the causes of process errors. In this paper, we present a novel approach for anomaly detection in business process logs. We model the event logs as a sequential data and apply kernel based anomaly detection techniques to identify outliers and discordant observations. Our technique is unsupervised (does not require a pre-annotated training dataset), employs kNN (k-nearest neighbor) kernel based technique and normalized longest common subsequence (LCS) similarity measure. We conduct experiments on a recent, large and real-world incident management data of an enterprise and demonstrate that our approach is effective.

研究动机与目标

  • 研究基于核函数的序列数据异常检测技术,以识别业务流程事件日志中的异常值,提出一种此前未在此领域应用的新方法。
  • 在大规模真实世界事后管理数据集上进行深入的实证分析,以验证所提方法的有效性。
  • 提供可复现的开源解决方案,用于流程挖掘中的异常检测,支持基准测试与未来研究。
  • 证明相似度核函数选择(如nLCS)和kNN参数(K)对检测结果具有显著影响。

提出的方法

  • 将业务流程事件日志建模为序列数据,将每个轨迹表示为活动序列。
  • 采用基于kNN的核方法,使用归一化最长公共子序列(nLCS)作为相似度度量,计算异常得分。
  • 通过测量在序列空间中到k个最近邻的平均距离来计算异常得分。
  • 使用核密度估计和z分数识别极端值作为潜在异常。
  • 通过与DISCO发现的流程模型对比,验证检测到的异常,重点关注不频繁的案例变体。
  • 使用z分数和直方图分析评估异常得分的分布,识别最异常的案例。

实验结果

研究问题

  • RQ1基于核函数的序列异常检测技术是否能在无需标注训练数据的情况下,有效识别业务流程事件日志中的异常值?
  • RQ2相似度核函数的选择(如nLCS)如何影响序列化流程轨迹中异常检测的性能与可靠性?
  • RQ3不同的kNN参数值(K)如何影响真实世界流程日志中异常案例的检测?
  • RQ4所提方法检测到的异常是否与流程挖掘工具(如DISCO)识别出的不频繁或异常的案例变体一致?
  • RQ5真实世界日志中异常得分的分布是否与正态分布类似,从而支持基于统计的阈值设定?

主要发现

  • 所提出的基于kNN的核方法结合nLCS相似度,成功在大规模真实世界事后管理数据集中检测出异常案例,最高异常得分达到4.582。
  • 当K=5000时,异常得分分布呈现类似正态分布的形态,均值为1.7692,标准差为0.2823,支持通过z分数进行统计阈值设定。
  • 前五个异常得分(4.582、4.127、4.106、3.464、3.325)对应的z分数高达9.966,表明与正常情况存在极端偏离。
  • 该方法识别出五个关键异常轨迹,其中包括一个包含重复活动序列的案例(如35;35;35;35;9;25;25;25;1;27;...),经DISCO流程模型验证为不频繁的案例变体。
  • 每案例的事件数量及案例变体的分布呈正偏态,表明大多数案例较短,而少数长且复杂的案例更可能为异常。
  • 本研究证实,核相似度度量(nLCS)与kNN参数(K)均显著影响检测结果,凸显超参数调优的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。