Skip to main content
QUICK REVIEW

[논문 리뷰] A Two-stage Framework and Reinforcement Learning-based Optimization Algorithms for Complex Scheduling Problems

Yong‐Ming He, Guohua Wu|arXiv (Cornell University)|2021. 03. 10.
Satellite Communication Systems참고 문헌 37인용 수 6
한 줄 요약

이 논문은 복잡한 스케줄링 문제를 위한 이중 단계 강화학습(RL)-기반 최적화 프레임워크를 제안한다. 이는 작업 할당을 위해 RL(유한 마르코프 결정 과정으로 모델링됨)을, 순서 매기기 및 시간 배정을 위해 운영 연구(OR) 기법(예: 정수형 혼합 프로그래밍)을 사용한다. 이 방법은 높은 품질의 안정적인 해를 효율적으로 도출하며, DQN 기반 알고리즘이 전통적인 방법보다도 속도와 해 품질 측면에서 민첩한 지구 관측 위성 스케줄링 문제에서 뛰어난 성능을 발휘한다.

ABSTRACT

There hardly exists a general solver that is efficient for scheduling problems due to their diversity and complexity. In this study, we develop a two-stage framework, in which reinforcement learning (RL) and traditional operations research (OR) algorithms are combined together to efficiently deal with complex scheduling problems. The scheduling problem is solved in two stages, including a finite Markov decision process (MDP) and a mixed-integer programming process, respectively. This offers a novel and general paradigm that combines RL with OR approaches to solving scheduling problems, which leverages the respective strengths of RL and OR: The MDP narrows down the search space of the original problem through an RL method, while the mixed-integer programming process is settled by an OR algorithm. These two stages are performed iteratively and interactively until the termination criterion has been met. Under this idea, two implementation versions of the combination methods of RL and OR are put forward. The agile Earth observation satellite scheduling problem is selected as an example to demonstrate the effectiveness of the proposed scheduling framework and methods. The convergence and generalization capability of the methods are verified by the performance of training scenarios, while the efficiency and accuracy are tested in 50 untrained scenarios. The results show that the proposed algorithms could stably and efficiently obtain satisfactory scheduling schemes for agile Earth observation satellite scheduling problems. In addition, it can be found that RL-based optimization algorithms have stronger scalability than non-learning algorithms. This work reveals the advantage of combining reinforcement learning methods with heuristic methods or mathematical programming methods for solving complex combinatorial optimization problems.

연구 동기 및 목표

  • 다양하고 복잡한 스케줄링 문제에 대한 일반적인, 효율적인 솔버의 부족을 해결하기 위해.
  • 대규모 조합 최적화의 계산 부담을 스케줄링을 두 상호의존적 단계로 분해함으로써 감소시키기 위해.
  • 강화학습과 운영 연구 기법을 통합하여 각각의 강점(즉, RL은 정책 학습, OR는 정확한 해 개선)을 활용하기 위해.
  • 실제 스케줄링 시나리오에서 RL 기반 최적화의 확장성, 수렴성 및 일반화 성능을 평가하기 위해.
  • 대표적인 복잡한 스케줄링 작업으로서 민첩한 지구 관측 위성 스케줄링 문제에서 이 프레임워크의 효과성을 입증하기 위해.

제안 방법

  • 프레임워크는 스케줄링을 두 단계로 분해한다: (1) 유한 마르코프 결정 과정(MDP)을 통해 딥 Q러닝(DQN)으로 해결하는 작업 할당, (2) 운영 연구 알고리즘으로 해결하는 순서 매기기 및 시간 배정.
  • MDP 단계는 즉각적 수익과 지연 수익을 균형 잡는 보상 함수를 사용하여, 수동 규칙 설계 없이 장기적인 스케줄링 정책을 학습할 수 있도록 한다.
  • OR 단계는 작업 할당 이후의 하위 문제를 고정형 휴리스틱(HADRT) 또는 동적 프로그래밍(DP)을 사용해 고정된 정확도로 해결한다.
  • 두 단계는 반복적으로 개선된다: OR 해 품질의 피드백에 기반해 RL 정책이 업데이트되어 시간이 지남에 따라 할당 결정이 향상된다.
  • 두 가지 구현 방식이 제안된다: DQN_CH(DQN + HADRT)와 DQN_DP(DQN + DP)로, 두 번째 단계에서 사용하는 OR 방법이 다르다.
  • 프레임워크는 시나리오 집합으로 훈련되고, 50개의 새로운, 훈련되지 않은 시나리오에서 일반화성과 강건성을 평가하기 위해 테스트된다.

실험 결과

연구 질문

  • RQ1RL과 OR를 조합한 이중 단계 프레임워크가 확장성과 효율성이 높은 복잡한 스케줄링 문제를 효과적으로 해결할 수 있는가?
  • RQ2DQN을 서로 다른 OR 방법(HADRT 대비 DP)과 통합할 경우, 해 품질과 계산 비용에 어떤 영향을 미치는가?
  • RQ3제안된 RL-OR 프레임워크는 훈련 세트 외의 새로운 스케줄링 시나리오에 잘 일반화되는가?
  • RQ4전통적 방법(B&B, ALNS 등)과 비교할 때, RL 기반 알고리즘의 해 품질과 실행 시간 측면에서의 성능는 어떠한가?
  • RQ5두 번째 단계에서 DP를 휴리스틱 대비 사용할 경우, 전체 최적화 성능에 어떤 영향을 미치는가?

주요 결과

  • DQN_DP는 모든 테스트 세트에서 DQN_CH, HADRT, ALNS, B&B를 모두 능가하는 최상의 종합 성능를 기록했으며, 특히 대규모 문제에서 두각을 나타냈다.
  • DQN_DP는 실행 시간이 선형적으로 증가하는 동안도 높은 해 품질을 유지했고, B&B는 H_20 이외의 모든 최소 테스트 세트에서 3600초 이내에 수렴하지 못했다.
  • HADRT와 DQN 기반 방법(DQN_CH, DQN_DP)은 낮은 표준편차를 보이며 안정적이고 빠른 계산 시간을 제공했고, ALNS와 B&B는 입력 민감도로 인해 높은 변동성을 보였다.
  • DQN 기반 알고리즘은 대규모 문제(C_400)에 대해 평균 2초 이내에 고품질의 해를 도출하여 뛰어난 확장성을 입증했다.
  • 프레임워크는 강력한 일반화 성능를 보였다: 훈련되지 않은 50개의 시나리오에서 안정적이고 효율적인 성능를 유지하여 훈련 분포 외에서도 강건함을 확인했다.
  • 특히 DP와의 통합을 통해 RL과 OR 기법의 융합이 우수한 결과를 도출했으며, 이는 고품질의 하위 문제 해가 MDP 단계의 전체 정책 학습을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.