[논문 리뷰] Large Language Models can accomplish Business Process Management Tasks
이 논문은 대규모 언어 모델인 GPT-4가 작업에 특화된 튜닝 없이도 텍스트에서 명령형 및 선언형 프로세스 모델을 채굴하고 RPA 적합성을 평가하는 등 세 가지 핵심 비즈니스 프로세스 관리(BPM) 작업을 효과적으로 수행할 수 있음을 입증한다. 성능은 전문 도구와 비교해도 열등하지 않거나 이를 초월한다. 이 접근법은 구조화된 출력 형식을 갖춘 간단한 지시 기반 프롬프팅을 사용하며, LLM을 활용한 일반 목적의 BPM 자동화 잠재력이 높음을 보여준다.
Business Process Management (BPM) aims to improve organizational activities and their outcomes by managing the underlying processes. To achieve this, it is often necessary to consider information from various sources, including unstructured textual documents. Therefore, researchers have developed several BPM-specific solutions that extract information from textual documents using Natural Language Processing techniques. These solutions are specific to their respective tasks and cannot accomplish multiple process-related problems as a general-purpose instrument. However, in light of the recent emergence of Large Language Models (LLMs) with remarkable reasoning capabilities, such a general-purpose instrument with multiple applications now appears attainable. In this paper, we illustrate how LLMs can accomplish text-related BPM tasks by applying a specific LLM to three exemplary tasks: mining imperative process models from textual descriptions, mining declarative process models from textual descriptions, and assessing the suitability of process tasks from textual descriptions for robotic process automation. We show that, without extensive configuration or prompt engineering, LLMs perform comparably to or better than existing solutions and discuss implications for future BPM research as well as practical usage.
연구 동기 및 목표
- 대규모 언어 모델(LLM)이 다양한 텍스트 기반 BPM 작업을 위한 일반 목적 도구로 기능할 수 있는지 조사하기 위해.
- GPT-4가 명령형 및 선언형 프로세스 모델 채굴, RPA 적합성 평가와 같은 세 가지 대표적인 BPM 작업에서의 성능을 평가하기 위해.
- 실제 BPM 시나리오에서 LLM의 입력 및 출력에 대한 내성적 저항성(로버스트니)을 평가하기 위해.
- LLM을 BPM 워크플로우에 활용하기 위한 실용적 지침을 제공하기 위해.
- LLM이 향후 BPM 연구 및 산업 응용에 미치는 영향을 탐색하기 위해.
제안 방법
- 모든 세 가지 작업에 동일한 통합 프롬프팅 프레임워크를 적용하며, 일관된 구조(작업 기술, 출력 형식 요구사항, 입력 텍스트, 선택적 few-shot 예시 포함)를 사용한다.
- GPT-4 모델(ChatGPT를 통해)을 미세조정이나 복잡한 프롬프팅 엔지니어링 없이 추론 엔진으로 사용한다.
- 출력 일관성은 다양한 저자로부터 작성된 프롬프트와 동일한 프롬프트의 여러 실행 결과를 테스트하여 평가한다.
- 정밀도, 재현율, F1-스코어와 같은 표준 지표를 사용해 기존의 전용 BPM 솔루션과 성능을 비교 평가한다.
- 출력은 평가를 위해 공식 프로세스 모델(BPMN, Declare) 또는 분류 레이블로 파싱된다.
- 입력 변동성과 모델의 비결정성 영향을 평가하기 위해 민감도 분석을 실시한다.

실험 결과
연구 질문
- RQ1GPT-4와 같은 단일 LLM이 지시 기반 프롬프팅만으로도 다양한 BPM 작업을 수행할 수 있는가?
- RQ2GPT-4의 성능은 프로세스 모델 채굴 및 RPA 적합성 평가 작업에서 전문 도구와 비교해 어떻게 되는가?
- RQ3LLM의 출력은 프롬프트 구성 방식의 변화와 모델의 무작위성에 얼마나 저항성이 있는가?
- RQ4출력 형식 명시와 few-shot 예시가 BPM 작업에서 LLM의 신뢰성 향상에 어떤 역할을 하는가?
- RQ5실제 BPM 워크플로우에서 LLM을 사용할 때의 실용적 함의와 제약 조건은 무엇인가?
주요 결과
- GPT-4는 모든 세 가지 작업에서 전문 벤치마크와 비교해도 동등하거나 뛰어난 F1-스코어를 기록했으며, 두 개의 RPA 적합성 작업에서 각각 0.69와 0.81의 F1-스코어를 기록했다.
- RPA 적합성 작업에서 GPT-4는 여섯 개의 프롬프트 중 네 개에서 벤치마크를 초월한 F1-스코어를 기록했으며, 특히 자동화되지 않은 작업의 재현율에서 뛰어난 성능을 보였다.
- 모델의 비결정성으로 인한 출력 변동성은 있었지만, 다양한 프롬프트 구성과 모델 실행 간에 입력 및 출력의 내성적 저항성이 상대적으로 높았다.
- 프롬프트에 예시를 포함시킴으로써 LTL에서 텍스트로의 변환 작업에서 성능 향상이 관찰되어, few-shot 학습이 복잡한 BPM 작업에서 LLM의 신뢰성 향상에 기여함을 시사한다.
- 장기적인 분류 작업에서 시간이 지남에 따라 성능 저하가 관찰되었으며, 이는 컨텍스트 윈도우 제한으로 인한 것으로 보이며, 장기 워크플로우에서 컨텍스트 관리의 필요성을 시사한다.
- 모델가 직접 공식 파일(BPMN 또는 Declare 파일 등)을 생성하지 못함에 따라 후처리가 필수적이며, 이는 현재 LLM이 BPM 툴링에서 겪는 주요 한계를 드러낸다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.