[论文解读] Large Language Models can accomplish Business Process Management Tasks
该论文表明,大型语言模型 GPT-4 可在无需任务特定微调的情况下,有效执行三项关键的业务流程管理(BPM)任务——从文本中挖掘指令式和声明式流程模型,以及评估RPA适用性,其性能与现有专用工具相当或更优。该方法采用简单的指令式提示(prompting)并使用结构化输出格式,展示了利用大型语言模型实现通用BPM自动化的强大潜力。
Business Process Management (BPM) aims to improve organizational activities and their outcomes by managing the underlying processes. To achieve this, it is often necessary to consider information from various sources, including unstructured textual documents. Therefore, researchers have developed several BPM-specific solutions that extract information from textual documents using Natural Language Processing techniques. These solutions are specific to their respective tasks and cannot accomplish multiple process-related problems as a general-purpose instrument. However, in light of the recent emergence of Large Language Models (LLMs) with remarkable reasoning capabilities, such a general-purpose instrument with multiple applications now appears attainable. In this paper, we illustrate how LLMs can accomplish text-related BPM tasks by applying a specific LLM to three exemplary tasks: mining imperative process models from textual descriptions, mining declarative process models from textual descriptions, and assessing the suitability of process tasks from textual descriptions for robotic process automation. We show that, without extensive configuration or prompt engineering, LLMs perform comparably to or better than existing solutions and discuss implications for future BPM research as well as practical usage.
研究动机与目标
- 探究大型语言模型(LLMs)是否可作为多种基于文本的BPM任务的通用工具。
- 评估GPT-4在三项代表性BPM任务上的表现:指令式与声明式流程模型挖掘,以及RPA适用性评估。
- 评估LLMs在真实BPM场景中对输入和输出的鲁棒性。
- 为在BPM工作流中使用LLMs提供实用指南。
- 探讨LLMs对未来BPM研究与工业应用的影响。
提出的方法
- 对所有三项任务采用统一的提示框架,结构一致:任务描述、所需输出格式、输入文本,以及可选的 few-shot 示例。
- 使用 GPT-4 模型(通过 ChatGPT)作为推理引擎,未进行微调或复杂的提示工程。
- 通过不同作者编写的多个提示以及同一提示的多次运行,评估输出的一致性。
- 使用标准指标(精确率、召回率、F1值)与现有专用BPM解决方案进行性能基准测试。
- 将输出解析为正式流程模型(BPMN、Declare)或分类标签以供评估。
- 进行敏感性分析,评估输入变化和模型非确定性对输出质量的影响。

实验结果
研究问题
- RQ1单一LLM(如GPT-4)是否仅通过指令式提示即可完成多种多样的BPM任务?
- RQ2GPT-4在流程模型挖掘和RPA适用性评估任务上的表现与专用、任务特定的BPM工具相比如何?
- RQ3LLM的输出在多大程度上对提示表述方式和模型随机性具有鲁棒性?
- RQ4输出格式规范和few-shot示例在提升LLM执行BPM任务可靠性方面发挥何种作用?
- RQ5在真实BPM工作流中使用LLMs的实际影响与局限性是什么?
主要发现
- GPT-4在所有三项任务上的F1值均达到或超过专用基准,其中两项RPA适用性任务的F1值分别为0.69和0.81。
- 在RPA适用性任务中,GPT-4在六组提示中的四组上优于基准模型,尤其在非自动化任务的召回率方面表现突出。
- 尽管受模型非确定性影响,输出存在一定程度的波动,但不同提示表述和模型运行之间的输入与输出鲁棒性仍相对较高。
- 在LTL转文本任务中,提示中加入示例可提升性能,表明few-shot学习有助于增强LLM在复杂BPM任务中的可靠性。
- 在长时间运行的分类任务中观察到性能随时间下降,可能由于上下文窗口限制所致,表明在长工作流中需引入上下文管理机制。
- 模型无法直接生成正式文件(如BPMN或Declare文件),因此必须进行后处理,凸显了LLMs在BPM工具链中当前存在的局限性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。