Skip to main content
QUICK REVIEW

[论文解读] SQL Queries for Declarative Process Mining on Event Logs of Relational Databases

Stefan Schönig|arXiv (Cornell University)|Dec 1, 2015
Business Process Modeling and Analysis参考文献 10被引用 3
一句话总结

本文提出一种基于SQL的声明式流程挖掘方法,可直接查询存储在数据库中的关系型事件日志,实现高效且可定制的过程约束发现。通过利用标准SQL和RelationalXES模式,该方法在不限制约束类型的情况下实现高性能,支持控制流和基于资源的模式(如基于角色的优先级),并提供置信度和支持度度量。

ABSTRACT

Flexible business processes can often be modelled more easily using a declarative rather than a procedural modelling approach. Process mining aims at automating the discovery of business process models. Existing declarative process mining approaches either suffer performance issues with real-life event logs or limit their expressiveness to a specific set of constaint types. Lately, with RelationalXES a relational database architecture for storing event log data has been introduced. In this technical report, we introduce a mining approach that directly works on relational event data by querying the log with conventional SQL. We provide a list of SQL queries for discovering a set of commonly used and mined process constraints.

研究动机与目标

  • 解决在真实事件日志上声明式流程挖掘中的性能瓶颈问题。
  • 克服现有方法将约束类型限制为预定义集合的局限性。
  • 直接从关系型数据库中实现灵活、可定制的声明式流程模型挖掘。
  • 通过标准SQL支持发现控制流和资源相关约束。
  • 通过基于SQL的查询将组织视角(如角色)整合到流程挖掘中。

提出的方法

  • 该方法使用标准SQL查询,通过RelationalXES(RXES)模式直接从存储在关系型数据库中的事件日志中挖掘过程约束。
  • 定义一组SQL查询,用于从Declare语言中发现常见的控制流约束,如响应(Response)、前驱(Precedence)和互斥(Mutual Exclusion)。
  • 通过将事件日志与来自Relation表的资源角色信息进行连接,将挖掘扩展至资源分配模式。
  • 使用子查询计算支持度和置信度度量,通过有效实例和轨迹的数量进行计数,并以总轨迹数进行归一化。
  • 通过基于资源角色过滤事件并结合时间顺序,支持基于角色的优先级和基于角色的响应约束。
  • 查询通过在Log表上使用自连接和相关子查询,评估时间顺序和组织条件。

实验结果

研究问题

  • RQ1是否可以使用标准SQL在大规模关系型事件日志上高效执行声明式流程挖掘?
  • RQ2基于SQL的查询是否可以在不硬编码约束类型的情况下发现广泛的声明式约束?
  • RQ3如何将组织角色整合到挖掘过程中,以发现依赖角色的过程模式?
  • RQ4是否可以使用标准SQL在归一化的关系型事件数据上准确计算支持度和置信度度量?
  • RQ5与现有声明式挖掘工具相比,基于SQL的方法在性能和表达能力方面有多大程度的提升?

主要发现

  • 基于SQL的挖掘方法通过利用关系型数据库的优化机制,实现了高性能,避免了内存中或专用引擎方法的可扩展性问题。
  • 该方法成功使用标准SQL查询发现常见的控制流约束,如响应(Response)、前驱(Precedence)和互斥(Mutual Exclusion)。
  • 支持基于资源的约束,如基于角色的优先级和基于角色的响应,实现组织视角的挖掘。
  • 通过子查询准确计算支持度和置信度度量,子查询计数有效实例和轨迹,分别设置0.7和0.5的阈值用于过滤。
  • 该方法完全可定制,用户无需修改底层挖掘引擎即可扩展查询以支持新约束类型。
  • 该方法在性能与表达能力之间实现了可行的平衡,优于那些为追求速度而牺牲灵活性的现有方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。