Skip to main content
QUICK REVIEW

[논문 리뷰] Learning policies for resource allocation in business processes

J. Middelhuis, Riccardo Lo Bianco|arXiv (Cornell University)|2023. 04. 19.
Scheduling and Optimization Algorithms인용 수 4
한 줄 요약

이 논문은 비즈니스 프로세스에서 자원 할당을 최적화하기 위한 두 가지 학습 기반 방법을 제안한다: 딥 강화학습(DRL)과 점수 기반가치함수근사(SVFA). DRL 방법은 환경과의 상호작용을 통해 적응형 정책을 학습하며, 복합 프로세스에서 벤치마크 대비 평균 13.1% 향상된 성능을 보였다. 반면 SVFA는 학습된 가중치를 가진 정제된 특징을 활용하여 할당을 순위 매긴다.

ABSTRACT

Efficient allocation of resources to activities is pivotal in executing business processes but remains challenging. While resource allocation methodologies are well-established in domains like manufacturing, their application within business process management remains limited. Existing methods often do not scale well to large processes with numerous activities or optimize across multiple cases. This paper aims to address this gap by proposing two learning-based methods for resource allocation in business processes to minimize the average cycle time of cases. The first method leverages Deep Reinforcement Learning (DRL) to learn policies by allocating resources to activities. The second method is a score-based value function approximation approach, which learns the weights of a set of curated features to prioritize resource assignments. We evaluated the proposed approaches on six distinct business processes with archetypal process flows, referred to as scenarios, and three realistically sized business processes, referred to as composite business processes, which are a combination of the scenarios. We benchmarked our methods against traditional heuristics and existing resource allocation methods. The results show that our methods learn adaptive resource allocation policies that outperform or are competitive with the benchmarks in five out of six scenarios. The DRL approach outperforms all benchmarks in all three composite business processes and finds a policy that is, on average, 12.7% better than the best-performing benchmark.

연구 동기 및 목표

  • 다양한 프로세스 패턴에 일반화되지 못하고 대규모 프로세스와 복잡한 플로우에 대해 확장성이 떨어지는 데이터 기반 비즈니스 프로세스 최적화(BPO)의 격차를 해소한다.
  • 표 형태의 Q-학습 및 히우리스틱 기반 접근법과 같이 다양한 프로세스 패턴 간에 일반화 능력이 떨어지는 기존 방법의 한계를 극복한다.
  • 다양한 케이스에서 평균 사이클 타임을 최적화하는 확장 가능하고 적응 가능한 학습 기반 자원 할당 정책을 개발한다.
  • 일반화 및 내구성 평가를 위해 고립된 대표적 프로세스 패턴과 실제적인 복합 프로세스 양쪽 모두에서 방법을 평가한다.
  • DRL이 수작업으로 설계된 특징에 의존하지 않고도 효과적인 정책을 학습할 수 있음을 입증하며, SVFA는 해석 가능한 순위 매기기를 위해 도메인 전문 지식을 활용한다.

제안 방법

  • 에이전트가 시뮬레이션 환경과 상호작용하면서 최적의 자원 할당을 학습하는 딥 강화학습(DRL)을 적용하며, 신경망을 사용해 Q-값 함수를 근사하고 고차원 상태 특징을 자동으로 추출한다.
  • 정제된 도메인 인식 특징(예: 평균 할당 시간, 자원 활용도 등)을 사용해 각 자원 할당에 대한 점수를 계산하는 점수 기반가치함수근사(SVFA) 방법을 구현한다.
  • 시뮬레이션된 사이클 타임에서 유도된 보상 값을 사용해, 할당의 상대적 품질을 예측하는 데 목적이 있는 지도 학습을 통해 SVFA 모델을 훈련한다.
  • 성능 향상을 위해 DRL 및 SVFA 모델의 하이퍼파라미터를 베이지안 최적화를 통해 튜닝한다.
  • 6개의 대표적 비즈니스 프로세스 모델(예: 병렬성, 선택, 고도의 활용도)을 설계하고, 이를 조합해 3개의 실제적인 복합 프로세스를 구성하여 확장성 및 일반화 능력을 테스트한다.
  • 세 가지 전통적 히우리스틱(FIFO, SPT, LPT)과 문헌에서 기존에 제시된 두 가지 BPO 방법과 비교하여 양 방법을 평가한다.
Figure 1 : An example of a business process model of a loan application process with two activities and two resources. Cases arrive according to some distribution with rate $\lambda$ , and the loans are either accepted (AA) or rejected (RA). Each activity can be performed by both resources $r_{1}$ a
Figure 1 : An example of a business process model of a loan application process with two activities and two resources. Cases arrive according to some distribution with rate $\lambda$ , and the loans are either accepted (AA) or rejected (RA). Each activity can be performed by both resources $r_{1}$ a

실험 결과

연구 질문

  • RQ1딥 강화학습은 다양한 비즈니스 프로세스 패턴에 일반화되며 기존 히우리스틱보다 뛰어난 성능을 보일 수 있는 적응형 자원 할당 정책을 학습할 수 있는가?
  • RQ2정제된 특징과 학습된 가중치를 사용하는 점수 기반가치함수근사(SVFA) 방법은 자원 할당 순위 매기기에 얼마나 효과적인가?
  • RQ3혼합된 플로우 패턴을 가진 복잡한 복합 비즈니스 프로세스에 통합되었을 때, 학습 기반 방법은 어느 정도 확장 가능하며 성능를 유지하는가?
  • RQ4고립된 프로세스 시나리오와 통합된 프로세스 시나리오 양쪽 모두에서 제안된 방법은 기존 BPO 접근법 대비 평균 사이클 타임 단축 측면에서 어떻게 비교되는가?
  • RQ5프로세스 프리픽스(즉, 케이스의 실행 이력)는 자원 할당 결정 향상에 어떤 역할을 하는가? 향후 확장에서 이를 어떻게 활용할 수 있는가?

주요 결과

  • DRL 기반 방법은 모든 세 개의 복합 비즈니스 프로세스에서 모든 벤치마크를 초월했으며, 최고 성능를 보인 베이스라인 대비 평균 13.1% 향상된 평균 사이클 타임을 달성했다.
  • 6개의 고립된 프로세스 시나리오 중 5개에서 제안된 학습 방법이 전통적 히우리스틱 및 기존 BPO 방법의 성능를 맞추거나 초월했다.
  • 고립된 시나리오에서는 SVFA 방법이 평균적으로 가장 우수한 성능를 보였지만, 복합 프로세스에서는 일반화 능력이 떨어져 DRL이 상당히 뛰어난 성능를 보였다.
  • 병렬성 시나리오에서는 첫 번째 도착한 작업부터 처리하는 FIFO 히우리스틱이 두 학습 방법을 모두 초월했다. 이는 실행 순서를 고려하지 못하는 현재 모델의 한계를 보여주며, 케이스 완료를 암묵적으로 우선순위화하기 때문이다.
  • 연구 결과는 DRL이 원시 상태 정보에서 관련 특징을 자동으로 학습할 수 있음을 입증하며, 수작업 특징 설계 없이 다양한 프로세스 구조에 매우 적응 가능하다는 것을 보여준다.
  • 결과적으로 SVFA는 도메인 설계 특징을 통해 해석 가능성을 제공하지만, DRL의 종단 간 학습 능력은 복잡한 실세계 프로세스 구성에서 훨씬 뛰어난 확장성과 내구성을 제공한다.
Figure 2 : Agent’s perspective of the agent-environment interaction, adapted from [ 19 ] .
Figure 2 : Agent’s perspective of the agent-environment interaction, adapted from [ 19 ] .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.