[论文解读] Process Model Forecasting Using Time Series Analysis of Event Sequence Data
本文提出了一种基于时间序列的创新方法,通过将直接后继关系(DFRs)建模为时间序列,直接从事件序列数据预测整个流程模型的未来行为。该方法在中等规模流程模型上的符合度误差(MAPE)低于15%,并引入了一套新的可视化分析系统(PCE),用于探索模型演化与漂移现象。
Process analytics is an umbrella of data-driven techniques which includes making predictions for individual process instances or overall process models. At the instance level, various novel techniques have been recently devised, tackling next activity, remaining time, and outcome prediction. At the model level, there is a notable void. It is the ambition of this paper to fill this gap. To this end, we develop a technique to forecast the entire process model from historical event data. A forecasted model is a will-be process model representing a probable future state of the overall process. Such a forecast helps to investigate the consequences of drift and emerging bottlenecks. Our technique builds on a representation of event data as multiple time series, each capturing the evolution of a behavioural aspect of the process model, such that corresponding forecasting techniques can be applied. Our implementation demonstrates the accuracy of our technique on real-world event log data.
研究动机与目标
- 为解决流程挖掘中缺乏模型级预测性流程监控的问题,特别是对未来流程行为的预测。
- 通过分析事件日志中行为模式的时间演化,实现对‘将要发生’的流程模型的预测。
- 支持流程分析师在瓶颈和流程漂移变得严重之前及时发现其征兆。
- 开发一个可视化分析系统(PCE),支持对过去、当前及预测的流程模型进行交互式对比。
- 使用熵相关性与平均百分比误差(MAPE)对预测模型的准确性进行评估。
提出的方法
- 将流程行为表示为多个时间序列,每个时间序列捕捉特定直接后继关系(DFRs)随时间的频率与权重变化。
- 对每个DFR时间序列应用标准时间序列预测技术——ARIMA、AR(2)、Holt-Winters、GARCH,以预测未来的DFRs。
- 从预测的DFRs重构预测的流程模型,形成直接后继图(DFG)。
- 使用熵相关性作为定量指标,评估预测DFG与实际未来DFG之间的符合度。
- 基于D3.js实现流程变更探索系统(PCE),支持通过交互式刷选与过滤功能,可视化历史、当前及预测的流程模型。
- 通过字母表缩减(50%、75%)降低模型复杂度,以提升预测稳定性与可解释性。
实验结果
研究问题
- RQ1对直接后继关系进行时间序列分析,能否准确预测整个流程模型的演化?
- RQ2在不同流程模型中,以及在不同字母表缩减程度下,预测准确率如何变化?
- RQ3预测模型在实际发生前,能在多大程度上揭示潜在的流程漂移与瓶颈?
- RQ4PCE可视化分析系统在支持流程分析师探索随时间变化的模型变更方面,效果如何?
- RQ5能否基于不同置信水平下的熵相关性,可靠地估计预测流程模型的置信区间?
主要发现
- 对于具有中等规模字母表(10–30个活动)的流程模型,预测模型在符合度方面平均百分比误差(MAPE)低于15%。
- ARIMA(2,1,2)与GARCH模型在多个数据集上均持续表现出低于其他时间序列方法的MAPE值。
- PCE系统使分析师能够直观识别出如某些活动比例下降(例如,罚款发送)以及结束活动的边权重随时间保持稳定等趋势。
- 该方法能以合理精度成功预测DFRs的频率与权重,关键转换的误差范围在±15%以内。
- 采用字母表缩减(50%与75%)可提升预测稳定性并降低误差,尤其在高复杂度模型中效果显著。
- 熵相关性度量能有效捕捉预测DFG与实际DFG之间的差异,支持对预测质量的定量评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。