Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid intelligence for dynamic job-shop scheduling with deep reinforcement learning and attention mechanism

Yunhui Zeng, Zijun Liao|arXiv (Cornell University)|2022. 01. 03.
Scheduling and Optimization AlgorithmsEngineering인용 수 19
한 줄 요약

이 논문은 스케줄링 상태를 이분할 그래프로 모델링하고 그래프 표현 학습을 위한 어텐션 메커니즘을 사용하는 동적 저작물 작업장 스케줄링(DJSP)을 위한 하이브리드 강화학습 프레임워크를 제안한다. 최적의 디스패칭 규칙을 선택하기 위해 듀얼 네트워크, 우선순위 경험 재생, 노이즈 네트워크를 결합한 새로운 D3QPN 에이전트를 활용하여, 모든 벤치마크 인스턴스에서 최신 기술(SOTA) 방법보다 더 낮은 메이크스팬을 달성한다. 복제 가능성과 표준화를 위해 공개된 Gymjsp 벤치마크도 함께 제공된다.

ABSTRACT

The dynamic job-shop scheduling problem (DJSP) is a class of scheduling tasks that specifically consider the inherent uncertainties such as changing order requirements and possible machine breakdown in realistic smart manufacturing settings. Since traditional methods cannot dynamically generate effective scheduling strategies in face of the disturbance of environments, we formulate the DJSP as a Markov decision process (MDP) to be tackled by reinforcement learning (RL). For this purpose, we propose a flexible hybrid framework that takes disjunctive graphs as states and a set of general dispatching rules as the action space with minimum prior domain knowledge. The attention mechanism is used as the graph representation learning (GRL) module for the feature extraction of states, and the double dueling deep Q-network with prioritized replay and noisy networks (D3QPN) is employed to map each state to the most appropriate dispatching rule. Furthermore, we present Gymjsp, a public benchmark based on the well-known OR-Library, to provide a standardized off-the-shelf facility for RL and DJSP research communities. Comprehensive experiments on various DJSP instances confirm that our proposed framework is superior to baseline algorithms with smaller makespan across all instances and provide empirical justification for the validity of the various components in the hybrid framework.

연구 동기 및 목표

  • 기존 디스패칭 규칙의 한계를 극복하여, 동적이고 불확실한 제조 환경에서 적응형이고 데이터 기반의 스케줄링 결정을 가능하게 한다.
  • 메타휴리스틱 및 수학적 프로그래밍 접근법이 동적 스케줄링 시나리오에서 일반화 및 확장성에 뒤처지는 문제를 해결한다.
  • 도메인 전문 디스패칭 규칙과 딥러닝을 통합하여 향상된 의사결정을 위한 융통성 있고 지식 증강된 강화학습 프레임워크를 개발한다.
  • OR-Library 기반의 표준화된 오픈소스 벤치마크(Gymjsp)를 제공하여 RL 기반 DJSP 알고리즘의 재현 가능하고 비교 가능한 평가를 가능하게 한다.
  • 다양한 DJSP 인스턴스에서 D3QPN 아키텍처의 핵심 구성 요소의 효과를 추론 연구와 실증 검증을 통해 입증한다.

제안 방법

  • 디스패칭 규칙의 집합을 행동 공간으로 사용하고, 이분할 그래프를 상태 표현으로 사용하는 마르코프 결정 과정(MDP)으로 동적 저작물 작업장 스케줄링 문제(DJSP)를 수식화한다.
  • 이분할 그래프 상태에서 의미 있는 맥락 인식 특징을 추출하기 위해 어텐션 메커니즘을 갖춘 그래프 신경망을 그래프 표현 학습(GRL) 모듈로 활용한다.
  • 이중 Q러닝, 듀얼 네트워크, 우선순위 경험 재생, 노이즈 네트워크를 통합한 새로운 D3QPN 에이전트를 설계하여 희박 보상 환경에서 학습 안정성과 정책 학습 성능을 향상시킨다.
  • 기계 이용률 향상과 메이크스팬 최소화를 기반으로 한 보상 함수를 사용하여 에이전트가 효율적인 스케줄링 결정을 유도한다.
  • D3QPN 에이전트를 GRL 모듈과 통합하여 각 상태(이분할 그래프)를 실시간으로 가장 적절한 디스패칭 규칙으로 매핑한다.
  • OR-Library 기반으로 공개된 표준화된 RL 환경인 Gymjsp를 개발하고 출시하여 DJSP 알고리즘의 재현 가능한 벤치마킹을 지원한다.

실험 결과

연구 질문

  • RQ1도메인 지식(디스패칭 규칙)과 딥러닝 기반 강화학습을 융합한 하이브리드 지능 프레임워크가 규칙 기반 및 메타휴리스틱 방법에 비해 동적 저작물 작업장 스케줄링에서 뛰어난 성능을 달성할 수 있는가?
  • RQ2어떤 정도로 어텐션 메커니즘이 스케줄링 상태 인코딩을 위한 이분할 그래프 표현의 구조적 및 시간적 종속성을 포착하는가?
  • RQ3D3QPN 아키텍처의 구성 요소들(듀얼, 우선순위 재생, 노이즈 네트워크)이 표준 DQN 및 Rainbow 베이스라인 대비 DJSP 성능 향상에 얼마나 기여하는가?
  • RQ4표준화된 오픈소스 벤치마크(Gymjsp)가 다양한 문제 인스턴스에서 RL 기반 DJSP 알고리즘의 공정하고 재현 가능한 평가를 가능하게 하는가?
  • RQ5제안된 프레임워크는 복잡도와 동적 특성이 다른 다양한 DJSP 인스턴스에 대해 일반화 가능한가?

주요 결과

  • 제안된 D3QPN 기반 프레임워크는 Gymjsp 환경의 모든 10개의 벤치마크 인스턴스에서 가장 강력한 베이스라인(DQN) 대비 평균 10%의 메이크스팬 감소를 달성했다.
  • la01 인스턴스에서는 메이크스팬을 베이스라인 DQN의 1600에서 1399로 감소시켜 12.5% 향상되었고, yn1에서는 다음으로 우수한 방법보다 7% 향상되었다.
  • 추론 연구를 통해 D3QPN의 각 구성 요소(듀얼, 노이즈 네트워크, 우선순위 재생)가 성능 향상에 긍정적인 기여를 했음을 확인했으며, 분포 기반 및 다단계 DQN 변종은 낮은 행동 공간 설정에서 간섭으로 인해 성능이 저하됨을 발견했다.
  • 학습 과정에서 D3QPN 에이전트는 학습 곡선상 가장 높고 안정된 누적 보상을 기록하여 정책 수렴의 강건성을 입증했다.
  • DQN과 Rainbow를 비롯해 PPO와 DDPG와 같은 다른 최신 기술(SOTA) RL 방법보다도 모든 테스트 인스턴스에서 메이크스팬 최소화 측면에서 프레임워크가 뛰어난 성능을 보였다.
  • 오픈소스로 공개된 Gymjsp 벤치마크는 표준화된 재현 가능한 평가를 가능하게 하며, 커뮤니티 사용을 위한 전체 코드와 데이터와 함께 출시되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.