Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Driven Heuristic Optimization

Qingpeng Cai, Will Hang|arXiv (Cornell University)|2019. 06. 16.
Scheduling and Optimization AlgorithmsEngineering참고 문헌 17인용 수 19
한 줄 요약

이 논문은 강화학습(PPO)을 사용하여 시뮬레이티드 어닐링(SA)과 같은 휴리스틱 최적화 알고리즘의 고품질 초기 해를 생성하는 RLHO라는 프레임워크를 제안한다. 이는 조합 최적화 문제에서 성능을 크게 향상시킨다. SA의 최종 해 품질을 보상 신호로 사용하여 RL 에이전트를 훈련시킴으로써, SA가 더 효과적으로 작동할 수 있도록 하는 초기화 전략을 학습할 수 있도록 한다. 이는 다양한 백팩 문제 크기에서 순수 강화학습과 무작위 초기화보다 우수한 성능을 보인다.

ABSTRACT

Heuristic algorithms such as simulated annealing, Concorde, and METIS are effective and widely used approaches to find solutions to combinatorial optimization problems. However, they are limited by the high sample complexity required to reach a reasonable solution from a cold-start. In this paper, we introduce a novel framework to generate better initial solutions for heuristic algorithms using reinforcement learning (RL), named RLHO. We augment the ability of heuristic algorithms to greedily improve upon an existing initial solution generated by RL, and demonstrate novel results where RL is able to leverage the performance of heuristics as a learning signal to generate better initialization. We apply this framework to Proximal Policy Optimization (PPO) and Simulated Annealing (SA). We conduct a series of experiments on the well-known NP-complete bin packing problem, and show that the RLHO method outperforms our baselines. We show that on the bin packing problem, RL can learn to help heuristics perform even better, allowing us to combine the best parts of both approaches.

연구 동기 및 목표

  • 무작위 초기 해에서 시작하는 시뮬레이티드 어닐링(SA)과 같은 휴리스틱 알고리즘의 높은 샘플 복잡도 문제를 해결하기 위해.
  • 우수한 초기 해를 생성함으로써 휴리스틱 최적화 성능을 향상시키기 위해 강화학습을 활용하기 위해.
  • 최종 해 품질을 보상 신호로 사용하여 휴리스틱 알고리즘의 성능을 기반으로 RL이 학습할 수 있도록 하기 위해.
  • 조합 최적화 문제인 백팩 문제와 같이 NP-완전 문제에서 RL과 휴리스틱을 조합하는 것이 순수 RL 또는 순수 휴리스틱 방법보다 더 나은 결과를 낼 수 있음을 보여주기 위해.

제안 방법

  • RLHO 프레임워크는 PPO 에이전트를 통해 초기 해를 생성하고, 이를 시뮬레이티드 어닐링(SA)을 사용해 개선하는 방식으로 번갈아가며 작동한다.
  • RL 에이전트는 SA의 최종 해 품질을 조밀하고 정보가 풍부한 보상 신호로 사용하여 정책 개선을 이끌어내도록 훈련된다.
  • RL 에이전트는 문제 상태를 관찰하고 항목을 상자에 할당하는 행동을 취함으로써 SA의 초기 해를 생성한다.
  • SA 구성 요소는 RL에 의해 생성된 초기 해에서 출발하여, 온도 스케줄에 기반한 변형과 수용 기반으로 근사적이고 확률적인 국소 탐색을 수행한다.
  • 훈련 루프는 RL 롤아웃과 SA 최적화를 번갈아 수행함으로써, 휴리스틱의 언덕 등반 행동을 통해 RL 에이전트가 더 나은 상태를 탐색할 수 있도록 한다.
  • 프레임워크는 PPO를 사용한 RL과 SA를 사용한 휴리스틱 최적화를 기반으로, 다양한 크기의 인스턴스를 가진 백팩 문제에서 평가되었다.

실험 결과

연구 질문

  • RQ1강화학습은 시뮬레이티드 어닐링과 같은 휴리스틱 최적화 알고리즘을 위한 더 나은 초기 해를 생성할 수 있는가?
  • RQ2휴리스틱 알고리즘의 최종 해 품질을 보상 신호로 사용할 경우, 조합 최적화에서 RL 에이전트의 성능이 향상되는가?
  • RQ3RL과 휴리스틱을 조합하면 순수 RL 또는 순수 휴리스틱 방법보다 더 나은 성능을 낼 수 있는가? (NP-완전 문제에서)
  • RQ4훈련 중보다 훨씬 긴 시간 동안 실행되는 휴리스틱에서도, RL 에이전트가 학습한 초기화 전략이 여전히 효과적인가?

주요 결과

  • 1000개 항목의 백팩 문제에서, RLHO는 SA가 50,000단계 동안 실행될 경우 무작위 초기화 시 평균 734개 상자에서 RLHO는 711개 상자로 감소시켰다.
  • 5000단계의 SA 실행 시, n=1000일 때 RLHO는 평균 714개 상자를 기록했고, 무작위 초기화 대비 2.7% 향상된 성능을 보였다.
  • SA를 수렴할 때까지 실행(수백만 단계)한 경우조차도, 5000단계의 SA만으로 훈련된 RLHO의 초기 해가 무작위 초기화를 능가했다.
  • 교차 최적화에서, 2000회의 훈련 반복 후 1000개 항목 문제에서 RLHO는 순수 PPO보다 2.1% 향상된 성능을 기록했으며, 더 나은 탐색 능력을 보였다.
  • RL 에이전트는 순수 RL이 최적 해에 수렴하지 못하는 상황에서도, SA의 언덕 등반 과정에 더 적합한 초기 해를 생성하는 전략을 학습했다.
  • 문제 크가 커질수록 RLHO와 무작위 초기화 간의 성능 격차가 커졌으며, 이는 더 큰, 더 복잡한 인스턴스에서 RLHO가 더 잘 스케일링됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.