[论文解读] Conversational Process Modeling: Can Generative AI Empower Domain Experts in Creating and Redesigning Process Models?
本文研究了生成式AI聊天机器人如何通过对话式建模协助领域专家创建和重构业务流程模型。论文提出了一套评估大语言模型(LLM)生成模型的框架,结合关键绩效指标(KPI)、提示词(prompts)和用户调查,发现尽管聊天机器人能够生成相对完整且正确的模型(控制流程正确率43%),但由于质量波动和语义理解能力的局限,人工监督仍然至关重要。
AI-driven chatbots such as ChatGPT have caused a tremendous hype lately. For BPM applications, several applications for AI-driven chatbots have been identified to be promising to generate business value, including explanation of process mining outcomes and preparation of input data. However, a systematic analysis of chatbots for their support of conversational process modeling as a process-oriented capability is missing. This work aims at closing this gap by providing a systematic analysis of existing chatbots. Application scenarios are identified along the process life cycle. Then a systematic literature review on conversational process modeling is performed, resulting in a taxonomy of application scenarios for conversational process modeling, including paraphrasing and improvement of process descriptions. In addition, this work suggests and applies an evaluation method for the output of AI-driven chatbots with respect to completeness and correctness of the process models. This method consists of a set of KPIs on a test set, a set of prompts for task and control flow extraction, as well as a survey with users. Based on the literature and the evaluation, recommendations for the usage (practical implications) and further development (research directions) of conversational process modeling are derived.
研究动机与目标
- 填补业务流程管理(BPM)领域中对聊天机器人在对话式流程建模(ConverMod)方面系统性分析的空白。
- 识别并分类ConverMod在业务流程生命周期中的应用场景。
- 开发并应用一套评估框架,以评估LLM生成的流程模型在完整性与正确性方面的表现。
- 为将聊天机器人整合进BPM工作流程提供实际应用启示与研究方向。
- 探究提示工程、文本表示方式及用户专业水平在模型质量结果中的作用。
提出的方法
- 开展系统性文献综述,构建ConverMod应用场景的分类体系,包括流程描述的改写与优化。
- 基于高等教育流程数据设计测试集,并用于评估LLM(GPT-3.5、GPT-4)在任务与控制流程提取方面的能力。
- 利用LLM输出结果通过Mermaid.js和Graphviz生成流程模型,以支持可视化验证。
- 定义一组关键绩效指标(KPI),对测试集上的模型完整性与正确性进行量化评估。
- 通过用户调查开展定性评估,比较金标准模型与LLM生成模型在完整性与正确性方面的表现。
- 将研究发现整合进一套方法论框架中,用于评估ConverMod能力,适用于专有及开源LLM。
实验结果
研究问题
- RQ1RQ1:对话式建模方法/工具如何应用于流程建模?
- RQ2RQ2:存在哪些用于流程建模的对话式建模方法/工具?
- RQ3RQ3:如何基于流程建模质量来评估对话式建模方法/工具?
- RQ4RQ4:聊天机器人对BPM建模实践与研究具有哪些实际与研究层面的启示?
主要发现
- LLM生成的流程模型在控制流程评估中平均正确率为43%,表明仍有显著提升空间。
- 尽管在语义正确性方面准确率较低,但用户调查中仍更偏好LLM生成的模型,无论其流程建模经验如何。
- LLM输出的模型完整性较高,但正确性——尤其是控制流程与语义结构方面——仍是主要挑战。
- 生成模型的质量对提示词设计、文本表示方式以及输入描述的复杂性高度敏感。
- 领域专家即使在存在金标准模型的情况下,也难以从多个LLM输出中选出最优模型。
- 当前现成的聊天机器人尚不可靠,难以胜任模型比较、查询或重构等高级任务,主要受限于对流程模型语义理解能力的不足。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。