Skip to main content
QUICK REVIEW

[论文解读] SUMMARIZED: Efficient Framework for Analyzing Multidimensional Process Traces under Edit-distance Constraint

Phuong Anh Nguyen, Vatche Ishakian|arXiv (Cornell University)|May 2, 2019
Semantic Web and Ontologies参考文献 35被引用 4
一句话总结

本文提出 Summarized,一种在编辑距离约束下高效分析多维过程轨迹的框架,通过将高维数据转换为用户可控的摘要空间,实现高效计算。通过引入基于属性和基于主题的摘要方案,并结合理论误差模型,该框架在保持或提升聚类质量的同时,显著提升了相似性计算速度——在基于摘要数据构建的过程模型中,表现出更高的符合度拟合度和更低的结构复杂度。

ABSTRACT

Domains such as scientific workflows and business processes exhibit data models with complex relationships between objects. This relationship is typically represented as sequences, where each data item is annotated with multi-dimensional attributes. There is a need to analyze this data for operational insights. For example, in business processes, users are interested in clustering process traces into smaller subsets to discover less complex process models. This requires expensive computation of similarity metrics between sequence-based data. Related work on dimension reduction and embedding methods do not take into account the multi-dimensional attributes of data, and do not address the interpretability of data in the embedding space (i.e., by favoring vector-based representation). In this work, we introduce Summarized, a framework for efficient analysis on sequence-based multi-dimensional data using intuitive and user-controlled summarizations. We introduce summarization schemes that provide tunable trade-offs between the quality and efficiency of analysis tasks and derive an error model for summary-based similarity under an edit-distance constraint. Evaluations using real-world datasets show the effectives of our framework.

研究动机与目标

  • 为解决多维过程轨迹中基于编辑距离的相似性计算带来的高计算成本问题。
  • 在业务流程和科学工作流等场景中,实现对复杂多属性序列的高效分析。
  • 为用户提供直观、可控的摘要方案,平衡分析效率与结果质量。
  • 为摘要空间中的编辑距离建立理论误差模型,确保基于相似性的分析结果的可靠性。
  • 在真实世界数据集上评估该框架,验证其在聚类和过程模型发现方面的有效性。

提出的方法

  • 将原始多维过程轨迹转换为低维摘要空间,以降低计算成本。
  • 引入基于属性的摘要,用户可选择特定属性(如 TrackedBy、Sector)定义摘要组。
  • 提出基于主题的摘要,利用聚类方法(如 LDA)将相似活动分组为主题,通过参数 k 实现可调节的粒度。
  • 推导出一个误差模型,界定在给定约束下,摘要空间中编辑距离与原始空间中编辑距离的偏差范围。
  • 在摘要数据上应用基于编辑距离的层次聚类,以发现紧凑且可解释的过程模型。
  • 使用 ProM 插件对基于 Petri 网模型的符合度拟合度和结构复杂度进行验证分析。

实验结果

研究问题

  • RQ1对多维过程轨迹进行摘要,是否能显著降低基于编辑距离分析的计算成本,同时保持或提升结果质量?
  • RQ2不同的摘要方案(基于属性 vs. 基于主题)如何影响轨迹聚类与过程模型发现的准确性与效率?
  • RQ3原始空间与摘要空间中编辑距离之间的理论关系是什么?是否可以建立边界?
  • RQ4基于主题的摘要在多大程度上能提供效率与效果之间的可调节权衡?
  • RQ5摘要是否能减少相似性计算中的噪声,从而提升模型拟合度与复杂度方面的聚类结果?

主要发现

  • 当 k=20 时,基于主题的摘要在符合度拟合度和结构复杂度方面,结果与语义上更合理的基于属性的摘要非常接近。
  • 基于属性的摘要,特别是使用 TrackedBy 属性时,始终产生最高的符合度拟合度和最低的结构复杂度,表明其具有较强的语义保留能力。
  • 随机摘要在这两项指标上表现最差,证实语义结构对有效聚类至关重要。
  • 该框架显著降低了处理时间——效率提升在图 9 中得到验证,其中基于主题的摘要在 Lithography、BPIC 和 Bank 数据集上均优于随机摘要。
  • Summarized 通过过滤相似性计算中的噪声,改善了聚类结果,使得基于摘要数据构建的过程模型比基于原始数据的分析更准确、更紧凑。
  • 理论误差模型为摘要空间中的可靠相似性估计提供了基础,增强了下游分析任务的可信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。