Skip to main content
QUICK REVIEW

[论文解读] A framework for mining process models from emails logs

Diana Jlailaty, Daniela Grigori|arXiv (Cornell University)|Sep 20, 2016
Personal Information Management and User Behavior参考文献 6被引用 6
一句话总结

本文提出了一种无监督框架,通过分层聚类和k-means聚类技术,从原始电子邮件日志中自动挖掘业务流程模型,以识别流程实例和活动,实现电子邮件的半自动标注,赋予活动名称,并支持未来活动识别,且仅需极少的人工输入。该方法成功从涉及会议组织和差旅资助申请的真实电子邮件数据集中提取了流程模型。

ABSTRACT

Due to its wide use in personal, but most importantly, professional contexts, email represents a valuable source of information that can be harvested for understanding, reengineering and repurposing undocumented business processes of companies and institutions. Towards this aim, a few researchers investigated the problem of extracting process oriented information from email logs in order to take benefit of the many available process mining techniques and tools. In this paper we go further in this direction, by proposing a new method for mining process models from email logs that leverage unsupervised machine learning techniques with little human involvement. Moreover, our method allows to semi-automatically label emails with activity names, that can be used for activity recognition in new incoming emails. A use case demonstrates the usefulness of the proposed solution using a modest in size, yet real-world, dataset containing emails that belong to two different process models.

研究动机与目标

  • 解决从无标注的原始电子邮件日志中发现未记录的业务流程的挑战,且无需手动标注的训练数据。
  • 开发一种方法,利用无监督学习技术自动将电子邮件聚类为流程实例,并识别相关活动。
  • 实现电子邮件的半自动标注,赋予活动名称,以支持未来活动识别和任务推荐系统。
  • 在涉及两种不同业务流程的真实世界、中等规模电子邮件数据集上,证明该框架的可行性和有效性。
  • 通过将原始消息转化为可分析的流程模型,将流程挖掘能力扩展至非结构化的电子邮件通信。

提出的方法

  • 应用多阶段聚类流程:首先使用分层聚类按主题对电子邮件进行分组,然后使用k-means聚类识别流程实例。
  • 利用所得聚类结果,指导电子邮件的半自动标注,赋予活动名称,减少对手动标注的依赖。
  • 利用无监督机器学习技术——特别是分层聚类和k-means聚类——无需预先知晓流程模型或活动的数量。
  • 通过清洗和标准化步骤,将原始、未经处理的电子邮件转化为适合聚类和流程挖掘的格式。
  • 将标注后的聚类作为未来新邮件中活动识别的训练集,支持智能任务列表推荐。
  • 通过将电子邮件日志映射为与现有流程挖掘工具兼容的事件日志,集成流程挖掘技术。

实验结果

研究问题

  • RQ1如何从无标注、非结构化的电子邮件日志中发现业务流程模型,且无需手动标注的训练数据?
  • RQ2无监督聚类技术在多大程度上能将电子邮件分组为有意义的流程实例和活动?
  • RQ3该框架能否通过基于聚类的标注方法,半自动地为电子邮件分配活动名称,从而减少人工标注工作量?
  • RQ4该方法在识别和区分单个电子邮件日志中多个并发流程模型方面的有效性如何?
  • RQ5所生成的标注数据能否支持未来在电子邮件工作负载中实现活动识别和智能任务推荐?

主要发现

  • 该框架成功从一个真实世界电子邮件数据集中,仅需极少人工干预,便发现了两个不同的流程模型——会议组织和会议差旅资助申请。
  • 分层聚类在缺乏对流程主题数量先验知识的情况下,有效识别了主题级别的分组。
  • k-means聚类能够识别每个主题聚类内的独立流程实例,支持实例级别的流程挖掘。
  • 基于聚类的标注方法提供了一种切实可行的半自动方法,用于为电子邮件分配活动名称,显著减少了对手动标注的需求。
  • 该框架在中等规模的真实世界数据集上展示了可行性,显示出与现有流程挖掘工具集成的潜力。
  • 该方法优于先前工作如EmailAnalyzer,因其无需在邮件主题中显式包含任务名称。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。