Skip to main content
QUICK REVIEW

[논문 리뷰] Graph neural networks-based Scheduler for Production planning problems using Reinforcement Learning

Mohammed Sharafath Abdul Hameed, Andreas Schwung|arXiv (Cornell University)|2020. 09. 08.
Scheduling and Optimization Algorithms인용 수 4
한 줄 요약

이 논문은 기계와 버퍼로 구성된 이분 그래프로 생산 시스템을 모델링하는 그래프 신경망(GNN) 기반 강화학습(RL) 프레임워크인 GraSP-RL을 제안한다. GNN을 통해 국소적이고 순서에 영향을 받지 않는 특징을 추출하고, 각 기계에 대해 분산된 분산형 RL 에이전트를 구현함으로써 30개 작업의 JSSP에서 최고의 메이크스팬 성능을 달성하며, 예측되지 않은 OSS 및 RJSSP 시나리오로의 일반화 능력이 뛰어나며, 재학습 없이 즉각적인 계획 수립이 가능하다. 이는 FIFO, TS, GA를 모두 능가한다.

ABSTRACT

Reinforcement learning (RL) is increasingly adopted in job shop scheduling problems (JSSP). But RL for JSSP is usually done using a vectorized representation of machine features as the state space. It has three major problems: (1) the relationship between the machine units and the job sequence is not fully captured, (2) exponential increase in the size of the state space with increasing machines/jobs, and (3) the generalization of the agent to unseen scenarios. We present a novel framework - GraSP-RL, GRAph neural network-based Scheduler for Production planning problems using Reinforcement Learning. It represents JSSP as a graph and trains the RL agent using features extracted using a graph neural network (GNN). While the graph is itself in the non-euclidean space, the features extracted using the GNNs provide a rich encoding of the current production state in the euclidean space, which is then used by the RL agent to select the next job. Further, we cast the scheduling problem as a decentralized optimization problem in which the learning agent is assigned to all the production units and the agent learns asynchronously from the data collected on all the production units. The GraSP-RL is then applied to a complex injection molding production environment with 30 jobs and 4 machines. The task is to minimize the makespan of the production plan. The schedule planned by GraSP-RL is then compared and analyzed with a priority dispatch rule algorithm like first-in-first-out (FIFO) and metaheuristics like tabu search (TS) and genetic algorithm (GA). The proposed GraSP-RL outperforms the FIFO, TS, and GA for the trained task of planning 30 jobs in JSSP. We further test the generalization capability of the trained agent on two different problem classes: Open shop system (OSS) and Reactive JSSP (RJSSP) where our method produces results better than FIFO and comparable results to TS and GA.

연구 동기 및 목표

  • 기존의 벡터화된 상태 표현에 의존하는 강화학습(RL) 접근법이 JSSP에서 보이는 확장성 및 일반화 한계를 해결하기 위해.
  • JSSP 내 기계, 작업, 버퍼 간의 본질적인 구조적 관계를 이분 그래프 구조로 모델링하기 위해.
  • 로컬 GNN 처리 특징을 기반으로 각 기계 수준에서 분산된 분산형 RL 학습을 가능하게 하여 확장성과 적응성 향상하기 위해.
  • 학습된 RL 에이전트의 일반화 능력을 예측되지 않은 문제 유형, 예를 들어 오픈 샵 시스템(OSS) 및 반응형 JSSP(RJSSP)에 대해 평가하기 위해.
  • 시간이 오래 걸리는 메타휴리스틱 기법(예: 타부 검색, GA)과 비교해 실시간 스케줄링 결정을 달성하기 위해.

제안 방법

  • 생산 환경은 기계와 기계 버퍼를 노드로 하는 이분 그래프로 모델링되어 작업과 자원 간의 상호의존성을 포괄한다.
  • 로컬 및 이웃 정보 기반으로 각 기계 노드에서 풍부하고 순서에 영향을 받지 않는 특징을 추출하기 위해 고유의 메시지 전달 알고리즘을 그래프 신경망(GNN) 내부에 적용한다.
  • GNN 처리 특징은 각 기계에서 독립적으로 작동하는 분산형 RL 에이전트의 입력으로 사용되며, 로컬 상태 기반으로 다음 처리 작업을 선택한다.
  • 메이크스팬의 역수 비례 보상 신호를 사용하여 엔드 투 엔드로 학습하며, 첫 5000 에피소드 동안 커리큘럼 학습을 적용한다.
  • 이 프레임워크는 선형 확장성을 제공한다: 전체 모델을 재학습하지 않고도 새로운 기계를 추가할 수 있으며, 다양한 문제 구성 간에 에이전트가 일반화된다.
  • 실제 주입 성형 생산 시스템(30개 작업, 4대의 기계)을 대상으로 평가하였으며, 다양한 작업 수와 동적 교란 요소가 있는 OSS 및 RJSSP에 대한 일반화 성능도 테스트하였다.

실험 결과

연구 질문

  • RQ1GNN 기반 표현은 벡터화된 상태 표현보다 RL에서 JSSP의 구조적 인덕티브 바이어스를 더 효과적으로 포착할 수 있는가?
  • RQ2GNN 처리 특징을 활용한 분산형, 기계 수준의 RL은 대규모 JSSP에서 확장성과 일반화 능력을 향상시키는가?
  • RQ3GraSP-RL 에이전트의 성능은 메이크스팬과 계획 시간 측면에서 전통적 디스패치 규칙(FIFO 등) 및 메타휴리스틱 기법(TS, GA 등)과 비교해 어떻게 되는가?
  • RQ4학습된 RL 에이전트는 추가 튜닝 없이도 예측되지 않은 문제 유형인 OSS 및 RJSSP에 일반화 가능한가?
  • RQ5제안된 방법은 계산 비용이 큰 메타휴리스틱 기법과 비교해 실시간 스케줄링 성능을 달성하는가?

주요 결과

  • GraSP-RL은 30개 작업, 4대 기계의 JSSP 작업에서 메이크스팬 최소화 측면에서 FIFO, 타부 검색(TS), 유전 알고리즘(GA)을 모두 능가하며, 모든 베이스라인 중 최고의 계획을 도출한다.
  • 재학습 없이도 오픈 샵 시스템(OSS) 및 반응형 JSSP(RJSSP)에 효과적으로 일반화되며, FIFO보다 우수한 결과를 내고 TS 및 GA와 유사한 성능을 기록한다.
  • 모든 테스트된 OSS 및 RJSSP 시나리오에서 에이전트의 평균 메이크스팬은 최고 성능 메타휴리스틱 기법과 1% 이내이며, 표준편차는 0.01 이하였다.
  • 에이전트는 즉각적인 스케줄 생성이 가능하다—Table 3에 나타나 있듯이 TS 및 GA보다 약 100배 더 빠르며, 각 계획 수립에 약 100배 더 많은 시간이 소요되었다.
  • GNN 기반 접근법은 다층퍼셉트론(MLP)을 사용한 비그래프 베이스라인보다 뚜렷이 우수한 성능을 보이며, JSSP 모델링에서 그래프 구조의 중요성을 입증한다.
  • 14~24개 작업 및 최대 8대의 기계 수에 걸쳐 다양한 작업 수와 기계 수에서도 성능가 유지됨을 확인하여, 강건성과 확장성의 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.