Skip to main content
QUICK REVIEW

[论文解读] Uncertain Process Data with Probabilistic Knowledge: Problem Characterization and Challenges

Izack Cohen, Avigdor Gal|arXiv (Cornell University)|Jun 6, 2021
Business Process Modeling and Analysis参考文献 4被引用 5
一句话总结

本文提出了一种新颖的框架,用于基于随机已知(SK)流程轨迹的符合性检查与流程分类——其中事件活动由概率分布表示,而非确定性标签。该框架通过引入新的成本结构和度量方法(如交叉熵和Frobenius范数),将传统符合性检查技术扩展至处理概率不确定性,解决了由传感器驱动和人工智能处理的事件数据带来的关键挑战。

ABSTRACT

Motivated by the abundance of uncertain event data from multiple sources including physical devices and sensors, this paper presents the task of relating a stochastic process observation to a process model that can be rendered from a dataset. In contrast to previous research that suggested to transform a stochastically known event log into a less informative uncertain log with upper and lower bounds on activity frequencies, we consider the challenge of accommodating the probabilistic knowledge into conformance checking techniques. Based on a taxonomy that captures the spectrum of conformance checking cases under stochastic process observations, we present three types of challenging cases. The first includes conformance checking of a stochastically known log with respect to a given process model. The second case extends the first to classify a stochastically known log into one of several process models. The third case extends the two previous ones into settings in which process models are only stochastically known. The suggested problem captures the increasingly growing number of applications in which sensors provide probabilistic process information.

研究动机与目标

  • 形式化随机已知(SK)流程轨迹的符合性检查问题,其中事件活动以概率分布表示。
  • 识别并描述三种具有挑战性的情形:(1) SK日志与确定性模型对比,(2) SK日志与多个确定性模型对比(分类),(3) SK日志与SK模型对比。
  • 应对日益增长的需求:开发保留来自传感器和机器学习系统中概率信息的符合性技术,而非将其简化为区间或确定性值。
  • 基于流程模型和观测日志的确定性水平(DK/SK)建立八类符合性检查的分类体系,突出不确定性传播的复杂性。

提出的方法

  • 基于流程模型的确定性水平(确定性已知/DK 或 随机已知/SK)和观测日志的确定性水平(DK 或 SK),提出八类符合性检查的分类体系。
  • 将随机已知轨迹表示为概率矩阵,其中行代表活动,列代表时间点/事件,条目表示在特定时间活动发生的概率。
  • 通过用基于Frobenius范数和交叉熵等成本函数的概率对齐替代传统确定性对齐,适应符合性检查技术,以度量SK轨迹与模型之间的差异。
  • 引入新的成本结构,以同时考虑观测轨迹和流程模型中的不确定性,实现在概率语义下的比较。
  • 通过评估SK日志与多个候选模型的符合性,并选择最佳匹配模型,将标准符合性检查扩展至分类任务。
  • 强调需要新的算法基础以保留概率语义,超越传统方法中通过区间边界丢弃不确定性的做法。

实验结果

研究问题

  • RQ1如何将符合性检查方法适配于处理随机已知(SK)流程轨迹,其中每个事件均与可能活动的概率分布相关联?
  • RQ2如何区分自然流程变异性引起的随机性与传感器或数据处理不确定性引起的随机性?
  • RQ3如何利用符合性检查将SK日志分类为多个流程模型之一?在该任务中,哪些概率度量最为有效?
  • RQ4在基于对齐的符合性检查中,使用概率成本函数(如交叉熵、Frobenius范数)替代确定性成本函数,其影响是什么?
  • RQ5如何将符合性检查扩展至观测日志和流程模型均为随机已知的情况?由此产生哪些新的方法论挑战?

主要发现

  • 本文识别出现有符合性检查技术中的一个关键缺口:它们通常将人工智能和传感器系统中的概率信息简化为确定性或有界表示,从而丢失了宝贵的不确定性上下文。
  • 作者证明,传统符合性检查方法无法适用于现代、由人工智能驱动的流程挖掘流水线,这些流水线会产生概率输出(例如,神经网络Softmax层的输出)。
  • 所提出的分类体系揭示了八种不同的符合性检查情形,其中情形5、7和8(即日志和模型中均存在不确定性)最为复杂且研究不足。
  • 研究表明,交叉熵和Frobenius范数等概率符合性度量是基于对齐技术在不确定性环境下作为成本函数的有力候选。
  • 本文强调了区分两种随机性来源的困难:流程变异性(例如,不同厨师遵循不同路径)与测量/处理噪声(例如,传感器误差或模型预测不确定性)。
  • 作者得出结论:必须建立新的算法基础,以正确建模和传播流程挖掘中的不确定性,尤其是在基于视频的流程监控和人工智能生成事件日志的应用中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。