[论文解读] Unsupervised Event Abstraction using Pattern Abstraction and Local Process Models
本文提出了一种无监督事件抽象方法,利用自动发现的局部过程模型(LPMs)作为活动模式,在过程发现前将低层次事件日志提升至更高抽象层次。通过筛选并应用这些LPMs来抽象事件,该方法改善了所发现过程模型的拟合度与精确度之间的平衡,BPI13-C日志的F-score从0.65提升至0.74,且在五个真实事件日志中的三个日志中也观察到性能提升。
Process mining analyzes business processes based on events stored in event logs. However, some recorded events may correspond to activities on a very low level of abstraction. When events are recorded on a too low level of granularity, process discovery methods tend to generate overgeneralizing process models. Grouping low-level events to higher level activities, i.e., event abstraction, can be used to discover better process models. Existing event abstraction methods are mainly based on common sub-sequences and clustering techniques. In this paper, we propose to first discover local process models and then use those models to lift the event log to a higher level of abstraction. Our conjecture is that process models discovered on the obtained high-level event log return process models of higher quality: their fitness and precision scores are more balanced. We show this with preliminary results on several real-life event logs.
研究动机与目标
- 解决低层次事件日志导致过程发现中产生过度泛化、不精确过程模型的问题。
- 通过用自动发现的LPMs替代人工领域知识,消除事件抽象对人工领域知识的依赖。
- 通过无监督方式从事件日志中发现更高层次的抽象,以提升过程模型质量。
- 评估基于LPM的抽象是否能带来更平衡的拟合度与精确度得分。
提出的方法
- 使用马尔可夫聚类和LPM挖掘技术,从原始低层次事件日志中发现局部过程模型(LPMs)。
- 基于多样性阈值对发现的LPM集合进行筛选,以保留具有代表性的行为模式。
- 将筛选后的LPMs用作活动模式,将原始事件日志抽象为更高层次的日志,用高层次活动标签替代低层次事件序列。
- 对抽象后的高层次日志应用标准过程发现算法(例如IM infrequent),以生成优化后的过程模型。
- 使用F-score(拟合度与精确度的调和平均值)评估模型质量,并比较抽象日志与原始日志的性能。
- 为实现公平比较与可解释性,将发现的高层次模型扩展其底层LPMs。
实验结果
研究问题
- RQ1从事件日志中发现的LPMs能否有效作为无监督事件抽象的活动模式?
- RQ2使用自动发现的LPMs对事件日志进行抽象,是否能改善所发现过程模型的精确度与拟合度平衡?
- RQ3LPM数量、多样性阈值以及组合方式(交错式与并行式)等参数如何影响模型质量?
- RQ4该抽象技术的性能是否依赖于底层事件日志的特性?
主要发现
- 从抽象后的BPI13-C日志中发现的过程模型F-score从0.65提升至0.74,表明拟合度与精确度之间实现了更好的平衡。
- 在五个真实事件日志中的三个日志中,所提出的抽象方法相较于直接在原始日志上进行过程发现,获得了更高的F-score。
- 用于抽象的最优LPM数量因日志而异,BPI13-C日志仅需1个LPM,而败血症日志则需5个LPM。
- 仅在一个案例中,并行组合LPMs提升了模型质量,表明在实践中交错组合可能更具效率,因而更可取。
- BPI13-C日志的模型精确度从0.53提升至0.86,而拟合度从0.84下降至0.65,表明在可接受的拟合度损失下,精确度实现了显著提升。
- 结果表明,该抽象技术的有效性高度依赖于日志特性和参数设置,因此需通过自动化参数调优实现完全自动化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。