Skip to main content
QUICK REVIEW

[論文レビュー] Graph neural networks-based Scheduler for Production planning problems using Reinforcement Learning

Mohammed Sharafath Abdul Hameed, Andreas Schwung|arXiv (Cornell University)|Sep 8, 2020
Scheduling and Optimization Algorithms被引用数 4
ひとこと要約

本稿では、工作機械とバッファをノードとする二部グラフとして生産システムをモデル化する、グラフニューラルネットワーク(GNN)を強化した強化学習フレームワーク、GraSP-RLを提案する。GNNを用いて局所的で順序に依存しない特徴を抽出し、各マシンに分散型の強化学習エージェントを設けることで、30ジョブのJSSPにおいて優れたマクスパン性能を達成し、未学習のOSSおよびRJSSPのシナリオに効果的に一般化され、再トレーニングなしに即座に計画を生成する。FIFO、TS、GAを上回る性能を発揮する。

ABSTRACT

Reinforcement learning (RL) is increasingly adopted in job shop scheduling problems (JSSP). But RL for JSSP is usually done using a vectorized representation of machine features as the state space. It has three major problems: (1) the relationship between the machine units and the job sequence is not fully captured, (2) exponential increase in the size of the state space with increasing machines/jobs, and (3) the generalization of the agent to unseen scenarios. We present a novel framework - GraSP-RL, GRAph neural network-based Scheduler for Production planning problems using Reinforcement Learning. It represents JSSP as a graph and trains the RL agent using features extracted using a graph neural network (GNN). While the graph is itself in the non-euclidean space, the features extracted using the GNNs provide a rich encoding of the current production state in the euclidean space, which is then used by the RL agent to select the next job. Further, we cast the scheduling problem as a decentralized optimization problem in which the learning agent is assigned to all the production units and the agent learns asynchronously from the data collected on all the production units. The GraSP-RL is then applied to a complex injection molding production environment with 30 jobs and 4 machines. The task is to minimize the makespan of the production plan. The schedule planned by GraSP-RL is then compared and analyzed with a priority dispatch rule algorithm like first-in-first-out (FIFO) and metaheuristics like tabu search (TS) and genetic algorithm (GA). The proposed GraSP-RL outperforms the FIFO, TS, and GA for the trained task of planning 30 jobs in JSSP. We further test the generalization capability of the trained agent on two different problem classes: Open shop system (OSS) and Reactive JSSP (RJSSP) where our method produces results better than FIFO and comparable results to TS and GA.

研究の動機と目的

  • 従来の強化学習(RL)手法がベクトル表現の状態に依存するため、ジョブショップスケジューリング(JSSP)におけるスケーラビリティと一般化性能の限界を克服すること。
  • JSSPにおけるマシン、ジョブ、バッファの間の構造的関係を二部グラフ構造でモデル化すること。
  • 各マシンレベルで局所的なGNN処理済み特徴を用いた分散型・分散型RL学習を可能とし、スケーラビリティと適応性を向上させること。
  • 訓練済みRLエージェントの未学習の問題クラス(例:オープンショップシステム(OSS)およびリアクティブJSSP(RJSSP))への一般化能力を評価すること。
  • メタヒューリスティクス(例:タブー探索、遺伝的アルゴリズム)と比較して、時間のかかる計算を要しない即時スケジューリング意思決定を達成すること。

提案手法

  • 生産環境を、マシンとマシンバッファをノードとする二部グラフとしてモデル化し、ジョブとリソース間の相互依存関係を捉える。
  • 各マシンノードの局所的および隣接情報に基づき、豊富で順序に依存しない特徴を抽出するため、独自のメッセージパッシングアルゴリズムをグラフニューラルネットワーク(GNN)に適用する。
  • GNNで処理されたノード特徴量を、各マシンで独立して動作する分散型RLエージェントの入力として使用し、局所状態に基づいて次の処理ジョブを選択する。
  • マクスパンの逆数に比例する報酬信号を用いてエンドツーエンドでエージェントをトレーニングし、最初の5000エピソードでカリキュラム学習を適用する。
  • フレームワークは線形スケーラビリティを実現:全モデルの再トレーニングなしに新しいマシンを追加可能であり、異なる問題設定間でエージェントが一般化可能である。
  • 本手法は、30ジョブ4マシンの実際の射出成形生産システムで評価され、ジョブ数や動的摂動が加わるOSSおよびRJSSPの一般化性についてもテストされた。

実験結果

リサーチクエスチョン

  • RQ1GNNベースの表現は、ベクトル化された状態表現に比べ、RLにおけるJSSPの構造的インダクティブバイアスをより効果的に捉えられるか?
  • RQ2GNN処理済み特徴を用いた分散型・マシンレベルのRLは、大規模JSSPにおけるスケーラビリティと一般化性能を向上させるか?
  • RQ3GraSP-RLエージェントの性能は、古典的ディスpatchルール(例:FIFO)およびメタヒューリスティクス(例:TS、GA)と比較して、マクスパンおよび計画時間の観点でどうなるか?
  • RQ4訓練済みRLエージェントは、さらに微調整なしに未学習の問題クラス(例:OSSおよびRJSSP)に一般化可能か?
  • RQ5本手法は、計算コストの高いメタヒューリスティクスと比較して、リアルタイムスケジューリング性能を達成できるか?

主な発見

  • GraSP-RLは、30ジョブ4マシンのJSSPタスクにおいて、FIFO、タブー探索(TS)、遺伝的アルゴリズム(GA)を上回り、すべてのベースラインの中で最良の計画を達成した。
  • 再トレーニングなしにオープンショップシステム(OSS)およびリアクティブJSSP(RJSSP)に効果的に一般化され、FIFOを上回り、TSおよびGAと同等の結果を出した。
  • テストされたすべてのOSSおよびRJSSPシナリオにおいて、エージェントの平均マクスパンは、最良のメタヒューリスティクスと1%以内であり、標準偏差は0.01未満であった。
  • エージェントは即座にスケジュールを生成した—TSおよびGAは100倍以上も時間がかかっており、表3に示すように、1回の計画生成に約100倍の時間がかかっていた。
  • GNNベースのアプローチは、マルチレイヤーパーセプトロン(MLP)を用いた非グラフベースのベースラインを顕著に上回り、JSSPのモデル化におけるグラフ構造の重要性を示した。
  • 14〜24ジョブのジョブ数や最大8台までのマシン数の変動に対しても、性能が維持されることから、堅牢性とスケーラビリティが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。