Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Large Neighborhood Search Policy for Integer Programming

Yaoxin Wu, Wen Song|arXiv (Cornell University)|2021. 11. 01.
Reinforcement Learning in Robotics참고 문헌 45인용 수 11
한 줄 요약

이 논문은 정수계획법(IP)을 위한 대규모 이웃 탐색(LNS) 정책을 학습하기 위해 깊이 강화학습 기법을 제안한다. 인자 분해된 행동 공간과 그래프 신경망을 사용하여 재최적화할 변수의 부분집합을 선택한다. 이 방법은 짧은 실행 시간 내에 SCIP과 Gurobi를 뛰어넘는 우수한 해 품질을 달성하며, 더 큰 문제로의 일반화 능력도 뛰어나다.

ABSTRACT

We propose a deep reinforcement learning (RL) method to learn large neighborhood search (LNS) policy for integer programming (IP). The RL policy is trained as the destroy operator to select a subset of variables at each step, which is reoptimized by an IP solver as the repair operator. However, the combinatorial number of variable subsets prevents direct application of typical RL algorithms. To tackle this challenge, we represent all subsets by factorizing them into binary decisions on each variable. We then design a neural network to learn policies for each variable in parallel, trained by a customized actor-critic algorithm. We evaluate the proposed method on four representative IP problems. Results show that it can find better solutions than SCIP in much less time, and significantly outperform other LNS baselines with the same runtime. Moreover, these advantages notably persist when the policies generalize to larger problems. Further experiments with Gurobi also reveal that our method can outperform this state-of-the-art commercial solver within the same time limit.

연구 동기 및 목표

  • 내부 솔버 접근 권한이 없이도 정수계획법의 해 품질을 향상시키는 기반 학습 기반의 LNS 프레임워크를 개발한다.
  • LNS에서 기하급수적으로 증가하는 행동 공간 문제를 해결하기 위해 변수 부분집합 선택을 각 변수의 독립적인 이진 결정으로 인자 분해한다.
  • 맞춤형 액터-크리틱 알고리즘을 사용하여 재최적화할 고품질의 변수 부분집합을 선택하는 정책 네트워크를 훈련시킨다.
  • 훈련된 정책이 더 큰, 미리보지 않은 IP 인스턴스로 일반화될 수 있도록 한다.
  • 엄격한 시간 제한 조건 하에서 기존의 상용 솔버(Gurobi)와 기존의 LNS 기반 기준선보다 뛰어난 성능을 입증한다.

제안 방법

  • 변수 부분집합의 행동 공간을 독립적인 이진 결정으로 분해하여, 각 변수가 파괴되거나 유지되는 방식으로 조합적 공간을 다룰 수 있도록 한다.
  • 매개변수 공유를 갖는 그래프 신경망(GNN)을 사용해 병렬로 각 변수의 파괴 확률을 예측함으로써 효율적인 정책 학습을 가능하게 한다.
  • 각 LNS 단계 이후의 해 품질 향상에 기반한 보상 신호를 사용하여, 맞춤형 액터-크리틱 강화학습 알고리즘으로 정책 네트워크를 훈련시킨다.
  • 수리 연산자는 표준 IP 솔버(SCIP 또는 Gurobi)를 사용하며, 이는 부분적으로 파손된 변수들을 하위 IP 문제로 재최적화한다.
  • 솔버 외부에서 작동하므로 솔버 내부 인터페이스나 상태 접근 권한이 필요하지 않다.
  • 정책은 IP 인스턴스의 분포에서 훈련되고, 훈련 크기의 인스턴스와 더 큰 일반화 인스턴스에서 평가된다.

실험 결과

연구 질문

  • RQ1기하급수적으로 증가하는 행동 공간이 존재하는 정수계획법에서 LNS를 위한 효과적인 변수 부분집합 선택을 깊이 강화학습 정책이 학습할 수 있는가?
  • RQ2실행 시간 제한 조건 하에서, 제안된 방법이 SCIP 및 Gurobi와 같은 최첨단 솔버보다 해 품질에서 뛰어나게 성능을 내는가?
  • RQ3재훈련 없이도 훈련된 LNS 정책이 더 큰, 미리보지 않은 IP 인스턴스로 일반화될 수 있는가?
  • RQ4고정된 크기의 파괴가 아닌, 적응형 변수 부분집합 선택 방식이 LNS에서 고정 크기 파괴 방식보다 더 우수한가?
  • RQ5외부 개선 히우리스틱으로서 사용될 경우, Gurobi와 같은 상용 솔버의 성능을 향상시킬 수 있는가?

주요 결과

  • 제안된 방법은 네 가지 벤치마크 IP 문제에서 SCIP의 1/5 수준의 실행 시간으로 더 나은 해 품질을 달성한다.
  • 동일한 실행 시간 제한 조건 하에서 모든 LNS 기반 기준선보다 뚜렷이 뛰어나며, 모든 테스트 문제에서 최적해 갭이 낮게 유지된다.
  • SC2, CA2, MC2와 같은 더 큰 인스턴스로의 일반화가 효과적으로 이루어지며, 기준선 및 솔버 대비 성능 우위를 유지한다.
  • Gurobi를 수리 연산자로 사용할 경우, 모든 테스트 문제에서 Gurobi 자체보다 뛰어난 성능을 내며, 35개의 MIPLIB 인스턴스 중 24개에서 Gurobi와 SCIP를 모두 초월한다.
  • 한 개의 개방형 MIPLIB 인스턴스에서 이전까지 알려진 최고 해보다 더 나은 해를 발견했다.
  • Gurobi를 사용할 경우 MC2에서 0.11%의 갭을 기록했으며, Gurobi 단독 사용 시 5.81%의 갭을 기록한 것과 비교해 대규모 문제에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.