[論文レビュー] Learning policies for resource allocation in business processes
本稿では、ビジネスプロセスにおけるリソース割り当て最適化のための2つの学習ベースの手法、すなわち深層強化学習(DRL)とスコアベースの価値関数近似(SVFA)を提案する。DRL手法は環境との相互作用を通じて適応的政策を学習し、合成プロセスにおいて平均して13.1%のベンチマーク上回る性能を達成する一方、SVFAは学習された重みを用いた整理された特徴を活用して割り当てをランク付けする。
Efficient allocation of resources to activities is pivotal in executing business processes but remains challenging. While resource allocation methodologies are well-established in domains like manufacturing, their application within business process management remains limited. Existing methods often do not scale well to large processes with numerous activities or optimize across multiple cases. This paper aims to address this gap by proposing two learning-based methods for resource allocation in business processes to minimize the average cycle time of cases. The first method leverages Deep Reinforcement Learning (DRL) to learn policies by allocating resources to activities. The second method is a score-based value function approximation approach, which learns the weights of a set of curated features to prioritize resource assignments. We evaluated the proposed approaches on six distinct business processes with archetypal process flows, referred to as scenarios, and three realistically sized business processes, referred to as composite business processes, which are a combination of the scenarios. We benchmarked our methods against traditional heuristics and existing resource allocation methods. The results show that our methods learn adaptive resource allocation policies that outperform or are competitive with the benchmarks in five out of six scenarios. The DRL approach outperforms all benchmarks in all three composite business processes and finds a policy that is, on average, 12.7% better than the best-performing benchmark.
研究の動機と目的
- 複数のケースと複雑なフローを伴う大規模プロセスにスケーリングできないデータ駆動型ビジネスプロセス最適化(BPO)におけるギャップを埋める。
- 表形式のQ学習やヒューリスティックに基づくアプローチといった既存手法の限界を克服し、多様なプロセスパターンに一般化しにくい問題を解決する。
- 複数のケースにおける平均サイクルタイムを最適化するスケーラブルで適応的な学習ベースのリソース割り当て政策を開発する。
- 一般化性と耐性を評価するために、孤立した代表的プロセスパターンと現実的な合成プロセスの両方で手法を評価する。
- DRLが手作業で特徴を設計することに依存せずに効果的な政策を学習できることを示す一方、SVFAはドメインエキスパート知識を活用して解釈可能なランク付けを実現する。
提案手法
- エージェントがシミュレーション環境と相互作用することで最適なリソース割り当てを学ぶ深層強化学習(DRL)を採用し、ニューラルネットワークを用いてQ値関数を近似し、高次元の状態特徴を自動的に抽出する。
- ドメインに裏付けられた特徴(例:平均割り当て時間、リソース利用率など)のセットを用いて、各リソース割り当てのスコアを計算するスコアベースの価値関数近似(SVFA)手法を実装する。
- シミュレートされたサイクルタイムから得られる報酬を用いて、教師あり学習によりSVFAモデルを訓練し、割り当ての相対的質を予測する。
- DRLおよびSVFAモデルの性能を向上させるために、ベイズ最適化を用いてハイパーパrameterをチューニングする。
- 6つの代表的ビジネスプロセスモデル(例:並列処理、選択、高利用率)を設計し、それらを組み合わせて3つの現実的で合成されたプロセスを構築し、スケーラビリティと一般化性能をテストする。
- 両手法を3つの従来のヒューリスティック(FIFO、SPT、LPT)および文献に登録された2つの既存のBPO手法と比較する。

実験結果
リサーチクエスチョン
- RQ1深層強化学習は、多様なビジネスプロセスパターンに一般化し、従来のヒューリスティックを上回る適応的リソース割り当て政策を学習できるか?
- RQ2整理された特徴と学習された重みを用いたスコアベースの価値関数近似(SVFA)手法は、リソース割り当てのランク付けにおいてどの程度有効か?
- RQ3学習ベースの手法は、混合フローパattersを有する複雑な合成ビジネスプロセスに統合された場合、どの程度スケーリングされ、性能を維持できるか?
- RQ4提案手法は、孤立した状況と統合された状況の両方において、既存のBPO手法と比較して平均サイクルタイム短縮の面でどの程度優れているか?
- RQ5プロセスプレフィックス(すなわち、ケースの実行履歴)はリソース割り当て意思決定を改善するためにどの程度役立つか?今後の拡張において活用可能か?
主な発見
- DRLベースの手法は、すべての3つの合成ビジネスプロセスにおいてすべてのベンチマークを上回り、最良のベースラインよりも平均して13.1%の平均サイクルタイム短縮を達成した。
- 6つの孤立プロセスシナリオのうち5つにおいて、提案された学習手法は従来のヒューリスティックおよび既存のBPO手法と同等またはそれ以上の性能を示した。
- 孤立シナリオにおいてSVFAは平均的に最も優れた性能を示したが、合成プロセスでは一般化が不十分であり、DRLが著しくそれを上回った。
- 並列処理シナリオでは、先着順(FIFO)ヒューリスティックが、処理の完了を内蔵的に優先するため、両学習手法を上回った。これは、現在のモデルが実行順序の処理を適切に扱えないという限界を示している。
- 本研究は、DRLが生の状態情報から関連する特徴を自動で学習できることを示しており、手作業による特徴工学を必要とせず、さまざまなプロセス構造に非常に適応可能であることを裏付けた。
- 結果から、SVFAはドメイン特徴を活用することで解釈可能性を提供するが、DRLのエンドツーエンド学習能力が、複雑で現実世界のプロセス設定において優れたスケーラビリティと耐性を提供することが示唆された。
![Figure 2 : Agent’s perspective of the agent-environment interaction, adapted from [ 19 ] .](https://ar5iv.labs.arxiv.org/html/2304.09970/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。