[论文解读] Business Process Deviance Mining: Review and Evaluation
本文提出了一种针对业务流程异常检测的序列分类技术的对比评估,重点关注频繁模式挖掘与区分性模式挖掘等特征提取方法,相较于简单的活动计数。研究发现,复合模式(例如MRA、基于IP的模式)显著提升了规则集的有趣性,并且在低变异性的流程中通常比基础计数方法在准确性上表现更优,尽管在高度变异的工作流中性能提升逐渐减弱。
Business process deviance refers to the phenomenon whereby a subset of the executions of a business process deviate, in a negative or positive way, with respect to its expected or desirable outcomes. Deviant executions of a business process include those that violate compliance rules, or executions that undershoot or exceed performance targets. Deviance mining is concerned with uncovering the reasons for deviant executions by analyzing business process event logs. This article provides a systematic review and comparative evaluation of deviance mining approaches based on a family of data mining techniques known as sequence classification. Using real-life logs from multiple domains, we evaluate a range of feature types and classification methods in terms of their ability to accurately discriminate between normal and deviant executions of a process. We also analyze the interestingness of the rule sets extracted using different methods. We observe that feature sets extracted using pattern mining techniques only slightly outperform simpler feature sets based on counts of individual activity occurrences in a trace.
研究动机与目标
- 系统性回顾并基于序列分类技术对现有业务流程异常检测方法进行分类。
- 评估不同特征提取方法——个体活动计数、频繁模式和区分性模式——在真实业务流程事件日志上的性能表现。
- 将分类准确率和挖掘出的规则集有趣性作为实际可用性的代理指标,评估其在解释异常流程执行方面的实用性。
- 识别哪些特征类型和分类方法能为流程分析师提供最具可操作性的洞察,同时保持高预测准确率。
- 探讨当前基于符号序列的方法在应用于具有丰富事件属性的复杂真实日志时的局限性。
提出的方法
- 使用Google Scholar进行系统性文献回顾,关键词涵盖业务流程异常、序列挖掘和区分性模式。
- 评估特征提取技术:(1) 个体活动频率计数,(2) 频繁模式挖掘(FP-Growth),(3) 区分性模式挖掘(MRA、IP、IA、基于集合的方法),(4) Fisher得分用于特征选择。
- 在提取的特征上应用标准分类算法(如决策树)构建分类器,以区分正常与异常的流程轨迹。
- 使用来自不同领域(如医疗、保险、MySQL)的真实事件日志,测试在平衡与非平衡异常条件下的性能表现。
- 使用多种有趣性度量评估规则集质量:phi相关系数、Yule’s Q、Piatetsky-Shapiro、信息增益、规则长度和%Generalization。
- 通过AUC和准确率指标对分类器进行基准测试,以评估其在不同数据集上的预测性能。
实验结果
研究问题
- RQ1在异常检测的分类准确率方面,不同特征提取技术(活动计数、频繁模式、区分性模式)之间的表现如何比较?
- RQ2复合模式(如MRA、基于IP的模式)相较于简单特征,在提升挖掘出的规则有趣性方面有多大程度的改善?
- RQ3基于模式的特征在低变异性和高度变异的业务流程中的表现是否存在显著差异?
- RQ4引入Fisher得分进行特征选择,对最终分类器的质量和预测能力有何影响?
- RQ5在不同特征类型和数据集之间,分类准确率与规则集可解释性(有趣性)之间的权衡关系如何?
主要发现
- 模式挖掘技术(如MRA、基于IP的模式)在所有数据集上均一致优于简单的活动频率计数,在phi相关系数和Piatetsky-Shapiro等度量上尤其表现出更高的规则集有趣性。
- 基于MRA和IP的规则集在多个数据集(包括Hospital1和Insurance1)中获得了最高的累积有趣性得分,且规则长度更短,%Generalization更高。
- 在低变异性的流程中,基于模式的特征显著提升了分类准确率(某些情况下AUC高达90%);而在高度变异的流程中,准确率提升可忽略不计,最高仅达到约80% AUC。
- 基于IA的规则集在大多数有趣性度量中表现较差,仅在Yule’s Q和信息增益方面随着规则集增大而有所提升,表明其实际应用价值有限。
- 基于集合和IP的特征在%Generalization和规则长度方面表现出轻微改进,表明其在规则表示上具有更好的泛化能力和简洁性。
- 本研究揭示了一个根本性局限:当前基于符号序列的方法忽略了丰富的事件载荷(如时间戳、属性-值对),提示未来研究需发展更复杂的符号序列挖掘方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。