Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to generalize Dispatching rules on the Job Shop Scheduling

Zangir Iklassov, Dmitrii Medvedev|arXiv (Cornell University)|2022. 06. 09.
Scheduling and Optimization Algorithms인용 수 5
한 줄 요약

이 논문은 작업장 스케줄링 문제(Job Shop Scheduling Problem, JSP)의 강화학습에서 일반화 능력을 향상시키기 위해 크기 무관성과 등변성(-equivariance_)을 갖춘 딥러닝 모델과 함께 새로운 강화된 적응형 계단식 커리큘럼 학습(RASCL) 전략을 제안한다. 커리큘럼 학습 중에 성능이 열 劣한 인스턴스를 동적으로 재학습시킴으로써, Taillard의 인스턴스에서 평균 최적성 간격을 10.46%로, Demirkol의 인스턴스에서 18.85%로 감소시켜 이전 최고 성능 방법들보다 뚜렷이 뛰어난 성능을 달성한다.

ABSTRACT

This paper introduces a Reinforcement Learning approach to better generalize heuristic dispatching rules on the Job-shop Scheduling Problem (JSP). Current models on the JSP do not focus on generalization, although, as we show in this work, this is key to learning better heuristics on the problem. A well-known technique to improve generalization is to learn on increasingly complex instances using Curriculum Learning (CL). However, as many works in the literature indicate, this technique might suffer from catastrophic forgetting when transferring the learned skills between different problem sizes. To address this issue, we introduce a novel Adversarial Curriculum Learning (ACL) strategy, which dynamically adjusts the difficulty level during the learning process to revisit the worst-performing instances. This work also presents a deep learning model to solve the JSP, which is equivariant w.r.t. the job definition and size-agnostic. Conducted experiments on Taillard's and Demirkol's instances show that the presented approach significantly improves the current state-of-the-art models on the JSP. It reduces the average optimality gap from 19.35\% to 10.46\% on Taillard's instances and from 38.43\% to 18.85\% on Demirkol's instances. Our implementation is available online.

연구 동기 및 목표

  • 기존의 강화학습 모델이 작업장 스케줄링 문제(JSP)에서 일반화 능력이 부족한 문제를 해결하기 위해.
  • 다른 문제 크기 간 지식 전이 시 치명적인 잊음(catastrophic forgetting)을 극복하기 위해.
  • 다양한 JSP 인스턴스 스케일에 걸쳐 일반화 가능한 크기 무관성과 등변성(-equivariance_)을 갖춘 딥러닝 모델을 개발하기 위해.
  • Taillard의 인스턴스와 Demirkol의 인스턴스와 같은 표준 기준 인스턴스에서 최적성 간격을 줄여 성능을 향상시키기 위해.
  • 모델의 강건성을 향상시키기 위해 가장 열 劣한 인스턴스에 적응적으로 집중하는 훈련 전략을 제시하기 위해.

제안 방법

  • 모델은 행동이 다음 작업을 스케줄링하기 위한 순차적 결정인 마르코프 결정 과정(MDP)으로 JSP를 수식화한다.
  • 작업 순서에 대한 등변성과 크기 무관성 아키텍처를 갖춘 딥 네트워크를 통해 다양한 문제 인스턴스 간 일반화를 가능하게 한다.
  • RASCL은 훈련 중에 성능이 가장 열 劣한 인스턴스를 식별하고 재학습시음으로써 커리큘럼 난이도를 동적으로 조정한다.
  • 저성능 인스턴스를 강화함으로써 커리큘럼 전략은 치명적인 잊음을 방지하고 다양한 척도 간 지식 전이를 보장한다.
  • 안정성을 확보하기 위해 경험 재생과 타겟 네트워크 업데이트를 사용한 정책 기반 강화학습 방식으로 훈련한다.
  • 점점 더 복잡한 인스턴스에서 훈련을 수행하며, RASCL은 어려운 케이스에 지속적인 주의를 기울인다.

실험 결과

연구 질문

  • RQ1강화학습 모델은 작업장 스케줄링 문제에서 다양한 문제 크기 간에 효과적으로 일반화될 수 있는가?
  • RQ2문제 크기를 확장할 때 치명적인 잊음을 방지하기 위해 커리큘럼 학습을 어떻게 향상시킬 수 있는가?
  • RQ3성능이 열 劣한 인스턴스에 대해 동적으로 재학습하면 모델의 일반화 능력과 해의 질이 향상되는가?
  • RQ4크기 무관성과 등변성을 갖춘 모델은 표준 JSP 기준 인스턴스에서 기존 방법들을 얼마나 뛰어넘을 수 있는가?
  • RQ5모델 성능에 기반해 난이도를 적응적으로 조절하는 커리큘럼 전략은 고정된 스케줄보다 더 낮은 최적성 간격을 달성할 수 있는가?

주요 결과

  • 제안된 RASCL 방법은 Taillard의 인스턴스에서 평균 최적성 간격을 19.35%에서 10.46%로 감소시켜 46% 향상되었다.
  • Demirkol의 인스턴스에서는 최적성 간격이 38.43%에서 18.85%로 감소하여 51% 향상되었다.
  • 크기 무관성과 등변성 아키텍처 덕분에 다양한 문제 크기 간 강력한 일반화 능력을 보였다.
  • RASCL은 난이도를 동적으로 조절하여 가장 열 劣한 인스턴스에 집중함으로써 표준 커리큘럼 학습보다 치명적인 잊음을 완화시키며 성능을 뛰어넘었다.
  • RASCL은 Taillard의 인스턴스와 Demirkol의 인스턴스 기준 세트에서 모두 최고 성능을 기록하여 이전의 RL 기반 접근법을 능가했다.
  • 구현 코드는 공개되어 있어 재현 가능성이 보장되며, 향후 RL 기반 스케줄링 분야의 연구를 위한 기반을 마련한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.