[论文解读] Prototype Selection Based on Clustering and Conformance Metrics for Model Discovery
该论文提出了一种增量原型选择方法,通过聚类处理轨迹来识别事件日志中的代表性实例(原型),并将其用于发现更高质量的过程模型。通过基于控制流距离和符合性度量的迭代原型选择,该方法在不增加模型复杂度的前提下,提升了各项质量标准的平衡性,且在真实事件日志中优于最先进的采样与过滤技术。
Process discovery aims at automatically creating process models on the basis of event data captured during the execution of business processes. Process discovery algorithms tend to use all of the event data to discover a process model. This attitude sometimes leads to discover imprecise and/or complex process models that may conceal important information of processes. To address this problem, several techniques, from data filtering to model repair, have been elaborated in the literature. In this paper, we introduce a new incremental prototype selection algorithm based on clustering of process instances. The method aims to iteratively compute a unique process model with a different set of selected prototypes, i.e., representative of whole event data and stops when conformance metrics decrease. The proposed method has been implemented in both the ProM and the RapidProM platforms. We applied the proposed method on several real event data with state-of-the-art, process discovery algorithms. Results show that using the proposed method leads to improve the general quality of discovered process models.
研究动机与目标
- 解决从大型、异构事件日志中发现过于复杂且不精确的过程模型的挑战。
- 改善过程发现中拟合度、精确度、泛化能力与简洁性之间的平衡。
- 开发一种与发现算法无关的方法,通过智能原型选择来提升模型质量。
- 在保留事件日志中关键行为模式的同时,降低数据变异性与模型复杂度。
- 提供一种稳定且增量式的方案,利用符合性检查来指导原型选择。
提出的方法
- 使用控制流距离对过程轨迹进行聚类,以归类相似的行为模式。
- 将每个聚类的质心选为代表性原型,确保覆盖多样化的流程变体。
- 使用标准发现算法从所选原型中构建过程模型。
- 通过符合性度量引导,迭代地从偏离轨迹中添加新原型,以平衡拟合度与精确度。
- 使用Fβ度量评估并引导增量选择过程,优先选择整体质量更优的模型。
- 该方法在ProM和RapidProM中实现,支持与现有流程挖掘工具及工作流的集成。
实验结果
研究问题
- RQ1基于聚类的原型选择相较于使用完整事件日志,如何提升所发现过程模型的质量?
- RQ2增量原型选择在多大程度上提升了过程模型在拟合度、精确度、泛化能力与简洁性之间的平衡?
- RQ3在原型选择过程中使用符合性度量如何影响模型质量与稳定性?
- RQ4所提出的方法是否能在真实世界事件日志中优于现有采样与过滤技术?
- RQ5原型选择策略(频率 vs. 聚类)对模型拟合度与精确度的影响如何?
主要发现
- 仅使用5%的轨迹作为原型(通过聚类选择)在Sepsis日志中实现了35%的轨迹覆盖率,表明在极小数据量下仍具有高拟合度。
- 当使用超过10个原型时,基于聚类的原型选择方法在拟合度上优于基于频率的选择方法,尤其在变体多样性高的日志中表现更优。
- 对于以频繁变体为主导的Road日志,基于频率的选择在较少原型下实现了更高覆盖率,但基于聚类的方法在复杂且异构的日志中表现更优。
- 该方法在多个真实世界日志及发现算法中,通过Fβ度量衡量,显著改善了拟合度与精确度之间的平衡。
- 所发现的模型比基于完整日志构建的模型更简洁、更易理解,同时保持了对观察行为的高符合度。
- 该方法在不同参数设置下表现出稳定性,并在质量度量上持续优于最先进的采样与过滤方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。