[論文レビュー] Large Language Models can accomplish Business Process Management Tasks
この論文は、大規模言語モデルであるGPT-4が、タスク固有のチューニングなしで、テキストから命令的および宣言的プロセスモデルを抽出し、RPAの適合性を評価するという、ビジネスプロセス管理(BPM)の3つの主要なタスクを効果的に行えることを示している。その性能は、専用の既存ツールと同等またはそれ以上であり、構造化された出力形式を用いたシンプルな指示ベースのプロンプトによって達成されている。これは、LLMを用いた汎用的BPM自動化の強力な可能性を示している。
Business Process Management (BPM) aims to improve organizational activities and their outcomes by managing the underlying processes. To achieve this, it is often necessary to consider information from various sources, including unstructured textual documents. Therefore, researchers have developed several BPM-specific solutions that extract information from textual documents using Natural Language Processing techniques. These solutions are specific to their respective tasks and cannot accomplish multiple process-related problems as a general-purpose instrument. However, in light of the recent emergence of Large Language Models (LLMs) with remarkable reasoning capabilities, such a general-purpose instrument with multiple applications now appears attainable. In this paper, we illustrate how LLMs can accomplish text-related BPM tasks by applying a specific LLM to three exemplary tasks: mining imperative process models from textual descriptions, mining declarative process models from textual descriptions, and assessing the suitability of process tasks from textual descriptions for robotic process automation. We show that, without extensive configuration or prompt engineering, LLMs perform comparably to or better than existing solutions and discuss implications for future BPM research as well as practical usage.
研究の動機と目的
- 大規模言語モデル(LLM)が、複数のテキストベースのBPMタスクに対して汎用的ツールとして機能できるかどうかを調査すること。
- GPT-4が、命令的および宣言的プロセスモデル抽出、およびRPA適合性評価という3つの代表的なBPMタスクにおいて、どの程度のパフォーマンスを示すかを評価すること。
- 実際のBPMシナリオにおけるLLMの入力および出力のロバストネスを評価すること。
- LLMをBPMワークフローに活用するための実用的ガイドラインを提供すること。
- LLMが今後のBPM研究および産業応用に与える影響を検討すること。
提案手法
- 3つのタスクすべてに統一されたプロンプティングフレームワークが適用され、一貫した構造(タスク説明、出力形式の要件、入力テキスト、およびオプションのfew-shot例)を採用している。
- GPT-4モデル(ChatGPT経由)が、ファインチューニングや膨大なプロンプト工学を一切行わずに推論エンジンとして使用されている。
- 出力の一貫性は、異なる著者による複数のプロンプトおよび同じプロンプトの複数回の実行をテストすることで評価されている。
- 標準指標(精度、再現率、F1スコア)を用いて、既存のタスク固有のBPMソリューションとパフォーマンスをベンチマーク比較している。
- 出力は、評価のための形式的プロセスモデル(BPMN、Declare)または分類ラベルに解析されている。
- 感度分析を実施し、入力の変動およびモデルの非決定的性質が出力品質に与える影響を評価している。

実験結果
リサーチクエスチョン
- RQ1GPT-4のような単一のLLMが、指示ベースのプロンプトのみで、多様なBPMタスクを一括して遂行できるか?
- RQ2GPT-4のパフォーマンスは、プロセスモデル抽出およびRPA適合性評価において、専用のタスク固有ツールと比べてどの程度か?
- RQ3LLMの出力は、プロンプトの表現方法の変化やモデルのランダムネスに対してどの程度ロバストか?
- RQ4出力形式の明確な指定とfew-shot例は、BPMタスクにおけるLLMの信頼性向上にどのような役割を果たすか?
- RQ5実際のBPMワークフローにおけるLLMの使用には、どのような実用的意義と制限があるか?
主な発見
- GPT-4は、3つのタスクすべてにおいて、専用ベンチマークと同等またはそれ以上のF1スコアを達成しており、2つのRPA適合性タスクのF1スコアはそれぞれ0.69および0.81であった。
- RPA適合性タスクにおいて、GPT-4は6つのプロンプトのうち4つでベンチマークを上回るF1スコアを示し、特に自動化対象でないタスクの再現率において優れた性能を発揮した。
- モデルの非決定的性質による出力のばらつきは一部認められたが、異なるプロンプト表現およびモデル実行回数においても、入力および出力のロバストネスは比較的高かった。
- プロンプトに例を含めることで、LTLからテキストへの変換タスクでのパフォーマンスが向上した。これは、few-shot学習が複雑なBPMタスクにおけるLLMの信頼性向上に寄与することを示唆している。
- 長時間にわたる分類タスクでは、時間の経過に伴いパフォーマンスの低下が観察された。これは、コンテキストウィンドウの制限に起因すると考えられ、長時間のワークフローではコンテキスト管理の必要性が示された。
- モデルが直接形式ファイル(例:BPMNやDeclareファイル)を生成できないため、後続の処理が必要である。これは、LLMがBPMツールリングにおいて現在抱える主な制限を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。