[论文解读] Entropia: A Family of Entropy-Based Conformance Checking Measures for Process Mining
该论文介绍了 Entropia,一个开源的命令行工具,用于实现基于熵的流程挖掘合规性检查度量,通过信息论方法精确且高效地量化模型的精确率与召回率。该工具支持精确匹配、可控部分匹配以及随机匹配,可通过可配置的不匹配容忍度进行性能调优,并提供可证明正确、理论基础坚实的模型-日志对齐度量指标。
This paper presents a command-line tool, called Entropia, that implements a family of conformance checking measures for process mining founded on the notion of entropy from information theory. The measures allow quantifying classical non-deterministic and stochastic precision and recall quality criteria for process models automatically discovered from traces executed by IT-systems and recorded in their event logs. A process model has "good" precision with respect to the log it was discovered from if it does not encode many traces that are not part of the log, and has "good" recall if it encodes most of the traces from the log. By definition, the measures possess useful properties and can often be computed quickly.
研究动机与目标
- 为解决基于信息论的熵基合规性检查度量缺乏工具支持的问题。
- 提供一个可扩展、高效且可扩展的命令行工具,用于量化流程模型评估中的精确率与召回率。
- 使流程分析师能够使用理论坚实、基于信息论的度量方法评估模型质量,特别是精确率与召回率。
- 支持非随机与随机合规性检查技术,并提供可配置的匹配策略(例如,可控部分匹配)。
- 与 LoLA 等现有工具集成,用于有界性检查,确保输入模型的正确性。
提出的方法
- 采用信息检索中的熵基度量方法,将精确率定义为共享行为与检索行为的比值,召回率定义为共享行为与相关行为的比值。
- 通过事件日志中迹集合的熵(作为相关行为)与流程模型中迹集合的熵(作为检索行为)来计算精确率与召回率。
- 实现三种主要的合规性检查技术:精确匹配(基于完整迹对齐)、可控部分匹配(支持可配置的跳过次数)以及随机匹配(使用概率分布)。
- 应用基于熵的相关性度量,评估模型与日志之间的信息论相似性,度量值以比特表示。
- 集成 LoLA 2.0 以自动验证输入流程模型的有界性,确保正确性并避免状态爆炸。
- 通过 CLI 暴露配置选项,支持配置匹配策略(例如,-srel=1 表示日志迹中最多允许一次跳过)、启用有界性检查(-b)以及跳过验证(-t)
实验结果
研究问题
- RQ1如何有效应用信息论中的熵基度量于流程挖掘的合规性检查中,以确保度量结果的合理性与可解释性?
- RQ2在真实世界流程挖掘场景中,精确匹配、可控部分匹配与随机合规性检查之间的性能权衡如何?
- RQ3可配置的匹配策略(例如,允许可控跳过)是否能在大规模流程模型中实现精确率、召回率与计算效率之间的平衡?
- RQ4熵基度量如何在统一的、工具支持的框架中同时支持非随机与随机合规性检查?
- RQ5在可扩展性与状态爆炸方面,熵基合规性检查的实际局限性是什么,以及如何缓解这些问题?
主要发现
- 基于 Petri 网与事件日志的熵基精确匹配精确率为 0.776,表明模型与观测行为之间具有较强的对齐性。
- 在模型中最多允许两次跳过、日志中最多允许一次跳过的可控部分匹配,精确率提升至 0.833,显示出对迹中微小变化的更强鲁棒性。
- 模型对日志的熵基相关性度量为 11.368 比特,量化了模型与观测行为之间的信息论相似性。
- 熵基相关性计算与日志大小(迹数 × 平均迹长)呈线性关系,支持大规模日志的高效处理。
- 精确匹配合规性检查在真实数据集上可在数秒内完成,而可控部分匹配由于存在较高的状态爆炸风险,仅适用于小规模输入。
- 通过迭代收敛实现的随机合规性检查在多数情况下运行迅速,但在复杂的真实数据集上可能较慢,表明仍需进一步优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。