Skip to main content
QUICK REVIEW

[論文レビュー] Learning to generalize Dispatching rules on the Job Shop Scheduling

Zangir Iklassov, Dmitrii Medvedev|arXiv (Cornell University)|Jun 9, 2022
Scheduling and Optimization Algorithms被引用数 5
ひとこと要約

本論文は、ジョブショップスケジューリング問題(JSP)における強化学習の一般化を向上させるために、サイズに依存しない等長性のある深層学習モデルと組み合わせた、新規の強化型適応的ステップアップカリキュラム学習(RASCL)戦略を提案する。カリキュラム学習中に性能が低いインスタンスを動的に再訓練することで、Taillardのインスタンスでは平均最適性ギャップを10.46%まで低下させ、Demirkolのインスタンスでは18.85%まで低下させ、先行する最先端手法を著しく上回る。

ABSTRACT

This paper introduces a Reinforcement Learning approach to better generalize heuristic dispatching rules on the Job-shop Scheduling Problem (JSP). Current models on the JSP do not focus on generalization, although, as we show in this work, this is key to learning better heuristics on the problem. A well-known technique to improve generalization is to learn on increasingly complex instances using Curriculum Learning (CL). However, as many works in the literature indicate, this technique might suffer from catastrophic forgetting when transferring the learned skills between different problem sizes. To address this issue, we introduce a novel Adversarial Curriculum Learning (ACL) strategy, which dynamically adjusts the difficulty level during the learning process to revisit the worst-performing instances. This work also presents a deep learning model to solve the JSP, which is equivariant w.r.t. the job definition and size-agnostic. Conducted experiments on Taillard's and Demirkol's instances show that the presented approach significantly improves the current state-of-the-art models on the JSP. It reduces the average optimality gap from 19.35\% to 10.46\% on Taillard's instances and from 38.43\% to 18.85\% on Demirkol's instances. Our implementation is available online.

研究の動機と目的

  • 既存の強化学習モデルがジョブショップスケジューリング問題(JSP)において一般化に欠けているという問題に対処すること。
  • 異なる問題サイズ間での知識移転において、崩壊的忘却を回避するためのカリキュラム学習の改善。
  • 多様なJSPインスタンススケールにわたる一般化を可能にするサイズに依存しない、等長性のある深層学習モデルの開発。
  • TaillardのインスタンスおよびDemirkolのインスタンスという標準ベンチマークで、最適性ギャップを低減することで性能を向上させること。
  • 最悪の性能を示すインスタンスに適応的に注目することで、モデルの頑健性を高める訓練戦略の提示。

提案手法

  • モデルは、JSPをマーカフ連鎖過程(MDP)として定式化し、行動は次の操作をスケジューリングする逐次的決定である。
  • ジョブ順序に対する等長性とサイズに依存しないアーキテクチャを持つ深層ニューラルネットワークにより、異なる問題インスタンス間での一般化が可能である。
  • RASCLは、トレーニング中に性能が最も低いインスタンスを特定し、再トレーニングすることでカリキュラムの難易度を動的に調整する。
  • カリキュラム戦略は、低性能インスタンスを強化することで、スケール間での知識移転を妨げない。
  • 安定性を高めるために、経験再生とターゲットネットワークの更新を用いた方策勾配法でモデルをトレーニングする。
  • 複雑度が増すインスタンスの順にトレーニングが行われ、RASCLにより困難なケースに継続的に注目が向けられる。

実験結果

リサーチクエスチョン

  • RQ1強化学習モデルは、ジョブショップスケジューリング問題において、多様な問題サイズに効果的に一般化できるか?
  • RQ2問題サイズの拡大に伴い、崩壊的忘却を防ぐためにカリキュラム学習をどのように改善できるか?
  • RQ3性能が低いインスタンスに対する動的再トレーニングが、モデルの一般化と解の質を向上させるか?
  • RQ4サイズに依存しない、等長性のあるモデルは、標準JSPベンチマークで既存手法をどれほど上回れるか?
  • RQ5モデルの性能に基づいて難易度を適応的に調整するカリキュラム戦略は、固定スケジュールに比べてより良い最適性ギャップを達成できるか?

主な発見

  • 提案されたRASCL手法により、Taillardのインスタンスにおける平均最適性ギャップは19.35%から10.46%に低下し、46%の改善が達成された。
  • Demirkolのインスタンスでは、最適性ギャップが38.43%から18.85%に低下し、51%の改善が達成された。
  • サイズに依存しないおよび等長性のあるアーキテクチャのおかげで、モデルは多様な問題サイズに強く一般化する。
  • RASCLは、最悪の性能を示すインスタンスに動的に注目することで、標準カリキュラム学習を上回り、崩壊的忘却を緩和する。
  • RASCLは、TaillardおよびDemirkolのベンチマークセットにおいて、先行するRLベースの手法を上回る最先端の性能を達成した。
  • 実装は公開されており、再現性とRLベースのスケジューリング分野におけるさらなる研究を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。