Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid intelligence for dynamic job-shop scheduling with deep reinforcement learning and attention mechanism

Yunhui Zeng, Zijun Liao|arXiv (Cornell University)|Jan 3, 2022
Scheduling and Optimization Algorithms被引用数 19
ひとこと要約

本論文は、スケジューリング状態を分岐グラフとしてモデル化し、アテンション機構を用いたグラフ表現学習を実装する、動的ジョブショップスケジューリング(DJSP)のためのハイブリッド強化学習フレームワークを提案する。状態の表現に分岐グラフを用い、最適なディスpatchingルール選択のための新規D3QPNエージェント(ダウエル型ネットワーク、優先順位付き経験再生、ノイズ付きネットワークを統合)を採用し、すべてのベンチマークインスタンスで最先端(SOTA)手法を上回るマケスパンを達成した。また、再現可能性と標準化のための新規公開Gymjspベンチマークを提供した。

ABSTRACT

The dynamic job-shop scheduling problem (DJSP) is a class of scheduling tasks that specifically consider the inherent uncertainties such as changing order requirements and possible machine breakdown in realistic smart manufacturing settings. Since traditional methods cannot dynamically generate effective scheduling strategies in face of the disturbance of environments, we formulate the DJSP as a Markov decision process (MDP) to be tackled by reinforcement learning (RL). For this purpose, we propose a flexible hybrid framework that takes disjunctive graphs as states and a set of general dispatching rules as the action space with minimum prior domain knowledge. The attention mechanism is used as the graph representation learning (GRL) module for the feature extraction of states, and the double dueling deep Q-network with prioritized replay and noisy networks (D3QPN) is employed to map each state to the most appropriate dispatching rule. Furthermore, we present Gymjsp, a public benchmark based on the well-known OR-Library, to provide a standardized off-the-shelf facility for RL and DJSP research communities. Comprehensive experiments on various DJSP instances confirm that our proposed framework is superior to baseline algorithms with smaller makespan across all instances and provide empirical justification for the validity of the various components in the hybrid framework.

研究の動機と目的

  • 動的で不確実な製造環境における伝統的ディスパッチルールの限界を克服し、適応的でデータ駆動型のスケジューリング意思決定を可能にする。
  • 動的スケジューリング状況において、メタヒューリスティクスおよび数学的プログラミング手法の一般化能力とスケーラビリティの低さを克服する。
  • ドメイン固有のディスパッチルールとディープラーニングを統合した、柔軟で知識拡張型の強化学習フレームワークを構築し、意思決定の質を向上させる。
  • OR-Libraryに基づく標準化されたオープンソースベンチマーク(Gymjsp)を提供し、RLベースのDJSPアルゴリズムの再現可能で比較可能な評価を可能にする。
  • アブレーションスタディおよび多様なDJSPインスタンスにおける実証的検証を通じて、D3QPNアーキテクチャの主要構成要素の有効性を実証する。

提案手法

  • 動的ジョブショップスケジューリング問題(DJSP)を、分岐グラフを状態表現とし、一般ディスパッチルールの集合を行動空間とするマルコフ決定過程(MDP)として定式化する。
  • 分岐グラフ状態からの意味的で文脈に適った特徴抽出のため、アテンション機構を備えたグラフニューラルネットワーク(GNN)をグラフ表現学習(GRL)モジュールとして採用する。
  • 二重Q学習、ダウエル型ネットワーク、優先順位付き経験再生、ノイズ付きネットワークを統合した新規D3QPNエージェントを設計し、スパarsely報酬環境における学習の安定化とポリシー学習の向上を図る。
  • マシンの利用率向上とマケスパン最小化に基づく報酬関数を用い、エージェントが効率的なスケジューリング意思決定を指向するように誘導する。
  • D3QPNエージェントをGRLモジュールと統合し、各状態(分岐グラフ)をリアルタイムで最も適切なディスパッチルールにマッピングする。
  • OR-Libraryに基づき、Gymjspと名付けた公開で標準化されたRL環境を開発・リリースし、DJSPアルゴリズムの再現可能なベンチマーク評価を支援する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン知識(ディスパッチルール)とディープ強化学習を統合したハイブリッドインテリジェンスフレームワークは、ルールベースおよびメタヒューリスティクス手法と比較して、動的ジョブショップスケジューリングで優れた性能を達成できるか?
  • RQ2アテンション機構は、スケジューリング状態符号化のための分岐グラフ表現における構造的および時間的依存関係をどれほど効果的に捉えられるか?
  • RQ3D3QPNアーキテクチャの構成要素(ダウエル型、優先順位付き再生、ノイズ付きネットワーク)は、標準DQNおよびRainbowベースラインと比較して、DJSPにおける性能向上にどの程度寄与するか?
  • RQ4標準化されたオープンソースベンチマーク(Gymjsp)は、多様な問題インスタンスにわたるRLベースのDJSPアルゴリズムの公平かつ再現可能な評価を可能にするか?
  • RQ5提案フレームワークは、複雑さや動的特性が異なる多様なDJSPインスタンスに一般化可能か?

主な発見

  • 提案されたD3QPNベースのフレームワークは、Gymjsp環境の全10インスタンスにおいて、最も強力なベースライン(DQN)と比較して平均10%のマケスパン低減を達成した。
  • la01インスタンスでは、マケスパンをベースラインDQNの1600から1399に低減し、12.5%の改善を達成した。yn1インスタンスでは、次善の手法と比較して7%の低減を達成した。
  • アブレーションスタディにより、D3QPNの各構成要素(ダウエル型、ノイズ付きネットワーク、優先順位付き再生)が性能向上に肯定的寄与していることが確認された。一方、分布型およびマルチステップDQN変種は、低行動空間設定での干渉により性能が低下した。
  • 学習曲線から、D3QPNエージェントは訓練中、最高かつ最も安定した累積報酬を達成しており、強固なポリシー収束を示している。
  • DQNおよびRainbowをはじめ、PPOやDDPGなどの他のSOTA RL手法に対しても、全テストインスタンスにおいてマケスパン最小化の観点で本フレームワークが優位であった。
  • オープンソースのGymjspベンチマークは、標準化された再現可能な評価を可能にし、コミュニティ利用のための完全なコードとデータとともにリリースされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。