Skip to main content
QUICK REVIEW

[논문 리뷰] ScheduleNet: Learn to solve multi-agent scheduling problems with reinforcement learning

Junyoung Park, Sanjar Bakhtiyar|arXiv (Cornell University)|2021. 06. 06.
Reinforcement Learning in Robotics참고 문헌 39인용 수 22
한 줄 요약

ScheduleNet는 다중 에이gent 스케줄링 문제를 반기의 제작시간 보상이 있는 반기의 MDP로 공식화하는 강화학습 기반의 분산형 스케줄러이다. 이는 에이gent-작업 관계를 그래프 표현으로 캡처하기 위해 유형 인식 그래프 어텐션 네트워크를 사용하며, 순차적 작업 배정을 위한 공유 정책을 학습한다. mTSP 및 JSP 벤치마크에서 히우리스틱 및 딥 강화학습 기반 베이스라인보다 뛰어난 성능을 보이며, 특히 대규모 설정에서 뛰어난 성능을 발휘한다.

ABSTRACT

We propose ScheduleNet, a RL-based real-time scheduler, that can solve various types of multi-agent scheduling problems. We formulate these problems as a semi-MDP with episodic reward (makespan) and learn ScheduleNet, a decentralized decision-making policy that can effectively coordinate multiple agents to complete tasks. The decision making procedure of ScheduleNet includes: (1) representing the state of a scheduling problem with the agent-task graph, (2) extracting node embeddings for agent and tasks nodes, the important relational information among agents and tasks, by employing the type-aware graph attention (TGA), and (3) computing the assignment probability with the computed node embeddings. We validate the effectiveness of ScheduleNet as a general learning-based scheduler for solving various types of multi-agent scheduling tasks, including multiple salesman traveling problem (mTSP) and job shop scheduling problem (JSP).

연구 동기 및 목표

  • mTSP 및 JSP와 같은 다양한 다중 에이gent 스케줄링 문제(mSPs)를 위한 일반적이고 실시간 스케줄러 개발
  • 총 완료 시간(제작시간)을 최소화하기 위해 에이gent 간 분산형, 협업적 조율 가능
  • 재학습 없이도 다양한 수의 에이gent와 작업에 일반화 가능한 확장 가능한 솔루션 설계
  • 신용 할당 문제와 보상 변동성 문제를 해결하기 위해 안정적인 학습 기반 제공
  • 기존 히우리스틱 및 딥 강화학습 방법 대비 대규모 mSPs에서 뛰어난 성능 입증

제안 방법

  • mSPs를 반기의 보상(제작시간)과 분산형 정책 학습을 갖춘 반기의 MDP로 공식화
  • 복잡한 상호의존성을 캡처하기 위해 스케줄링 상태를 에이gent-작업 그래프로 표현
  • 유형 인식 그래프 어텐션(TGA)을 사용해 그래프에서 관계 임베딩을 추출하여 에이gent 및 작업 노드 간의 차이를 구분
  • 노드 임베딩을 사용해 할당 확률을 계산하고 순차적 작업 배정 결정을 안내
  • 희박하고 반기의 팀 보상 환경에서 학습을 안정화하기 위해 고유한 강화학습 학습 기반 사용
  • 모든 에이gent에 대해 단일 공유 정책을 학습하여 더 큰 문제 인스턴스로의 전이 가능성 확보

실험 결과

연구 질문

  • RQ1단일 공유 분산 정책이 다양한 다중 에이gent 스케줄링 문제를 효과적으로 해결할 수 있는가?
  • RQ2희박하고 반기의 팀 보상(예: 제작시간) 환경에서 협업 행동을 어떻게 학습할 수 있는가?
  • RQ3그래프 기반 강화학습 접근 방식이 mTSP 및 JSP와 같은 다양한 mSPs에 일반화 가능한가?
  • RQ4기존 기반선 대비 제안된 방법이 대규모 mSPs에 어떻게 스케일링되는가?
  • RQ5어떤 학습 기반 기반으로 고분산, 조합적 mSPs에서 안정적인 학습이 가능해지는가?

주요 결과

  • ScheduleNet은 mTSP 및 JSP 벤치마크에서 히우리스틱 기반 베이스라인과 기존 딥 강화학습 방법보다 뛰어난 성능을 보였다.
  • 대규모 mSP 인스턴스에서 뛰어난 제작시간 성능를 달성하여 확장성 입증
  • 제안된 학습 기반은 표준 PPO 대비 학습 안정성과 점진적 성능 향상에 크게 기여
  • GN-PPO는 가치 함수 목표의 높은 변동성과 벨먼 오차 전파로 인해 ScheduleNet에 비해 성능 열 劣
  • 유형 인식 그래프 어텐션 메커니즘은 에이gent-작업 그래프 내의 관계적 구조를 효과적으로 포착하여 더 나은 의사결정 가능
  • 공유된 분산 정책 아키텍처 덕분에 ScheduleNet은 예측 불가능한 문제 크기로도 잘 일반화됨

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.