Skip to main content
QUICK REVIEW

[논문 리뷰] A Deep Reinforcement Learning Framework For Column Generation

Cheng Chi, Amine Mohamed Aboussalah|arXiv (Cornell University)|2022. 06. 03.
Vehicle Routing Optimization Methods인용 수 14
한 줄 요약

이 논문은 컬럼 생성(Column Generation, CG)을 가속화하기 위해 깊이 강화학습 기반의 RLCG를 제안한다. 컬럼 선택을 순차적 의사결정 문제로 모델링함으로써, 선형계획법의 구조를 그래프 신경망(GNN)을 사용해 인코딩하고, 커스터마이즈된 보상 함수를 갖춘 Q-학습을 적용하여, 커팅 스톡 문제(Cutting Stock Problem)에서는 평균 22.4% 감소, 차량 경로 문제 시간 창 제한(Vehicle Routing Problem with Time Windows)에서는 40.9% 감소한 CG 반복 횟수를 달성한다. 이는 탐욕 정책보다 우수하다.

ABSTRACT

Column Generation (CG) is an iterative algorithm for solving linear programs (LPs) with an extremely large number of variables (columns). CG is the workhorse for tackling large-scale extit{integer} linear programs, which rely on CG to solve LP relaxations within a branch and price algorithm. Two canonical applications are the Cutting Stock Problem (CSP) and Vehicle Routing Problem with Time Windows (VRPTW). In VRPTW, for example, each binary variable represents the decision to include or exclude a extit{route}, of which there are exponentially many; CG incrementally grows the subset of columns being used, ultimately converging to an optimal solution. We propose RLCG, the first Reinforcement Learning (RL) approach for CG. Unlike typical column selection rules which myopically select a column based on local information at each iteration, we treat CG as a sequential decision-making problem: the column selected in a given iteration affects subsequent column selections. This perspective lends itself to a Deep Reinforcement Learning approach that uses Graph Neural Networks (GNNs) to represent the variable-constraint structure in the LP of interest. We perform an extensive set of experiments using the publicly available BPPLIB benchmark for CSP and Solomon benchmark for VRPTW. RLCG converges faster and reduces the number of CG iterations by 22.4\% for CSP and 40.9\% for VRPTW on average compared to a commonly used greedy policy. Our code is available at https://github.com/chichengmessi/reinforcement-learning-for-column-generation.git.

연구 동기 및 목표

  • 컬럼 생성(CG)에서 단기적인 감소 비용에만 기반해 컬럼을 선택하는 탐욕적 선택 히우리스틱의 비효율성을 해결하고자 한다. 이는 장기적 수렴 성능를 고려하지 않는 한계를 가진다.
  • 각 반복에서의 컬럼 선택이 향후 선택과 전체 수렴 속도에 영향을 주므로, CG를 순차적 의사결정 문제로 모델링하고자 한다.
  • 커팅 스톡 문제와 VRPTW와 같이 변수 수가 지수적으로 증가하는 대규모 선형계획법 문제에 대해, 강화학습을 통해 정책을 학습함으로써 CG의 수렴 속도를 향상시키고자 한다.
  • 다양한 크기와 복잡도를 가진 문제 인스턴스에 걸쳐, 도메인 특화 조정이 최소한으로 필요한 효과적인 교육 커리큘럼을 설계하고자 한다.
  • 기존의 탐욕 정책과 계산 비용이 높은 한 단계 앞서보는 히우리스틱보다 반복 횟수와 총 솔루션 시간 측면에서 모두 뛰어난 성능을 내고자 한다.

제안 방법

  • 선형계획법(LP)의 변수-제약 조건 상호작용을 이분 그래프로 표현하고, 그래프 신경망(GNN)을 사용해 상태를 인코딩하여 구조적 정보를 캡처한다.
  • CG에서의 컬럼 선택을 마르코프 결정 과정(MDP)으로 공식화하며, 상태는 현재의 제한된 마스터 문제(RMP)이고, 행동은 추가할 컬럼 선택이다.
  • 반복 횟수를 높게 유지하거나 수렴 속도를 느리게 하는 것을 방지하기 위해, 조밀하고 희소하며 형태가 조정된 보상 함수를 설계한다.
  • 상태에서 기대 누적 보상을 최대화하는 Q-함수를 학습하기 위해 딥 Q-네트워크(DQN)를 훈련시켜, 총 반복 횟수를 최소화하는 컬럼 선택을 가능하게 한다.
  • 작고 단순한 인스턴스에서 시작하여 점차 복잡도를 높이는 커리큘럼 학습 전략을 구현하여 훈련의 안정성과 일반화 능력을 향상시킨다.
  • 훈련 안정성 향상과 샘플 효율성 향상을 위해 타겟 네트워크와 경험 재생(Experience Replay)을 활용한다.

실험 결과

연구 질문

  • RQ1강화학습이 컬럼 생성에 효과적으로 적용되어 수렴에 필요한 반복 횟수를 줄일 수 있는가?
  • RQ2강화학습을 통해 순차적 컬럼 선택 정책을 학습하면, 가장 음수의 감소 비용을 가진 컬럼을 선택하는 탐욕 히우리스틱보다 성능이 뛰어나지 않는가?
  • RQ3GNN 기반 상태 표현이 대규모 LP의 구조적 및 수치적 특성을 효과적으로 인코딩할 수 있는가?
  • RQ4다양한 분포의 CG 문제 인스턴스에 걸쳐 강화학습 에이전트를 효율적으로 훈련시키기 위해 커리큘럼 학습을 어떻게 설계할 수 있는가?
  • RQ5강화학습 기반 컬럼 선택 정책이 CSP와 VRPTW의 다양한 문제 크기와 데이터 분포에 대해 일반화 가능한가?

주요 결과

  • BPPLIB 벤치마크에서 커팅 스톡 문제(CSP)에 대해 RLCG는 탐욕 정책 대비 평균적으로 22.4% 감소한 CG 반복 횟수를 기록한다.
  • 솔로몬 벤치마크에서 차량 경로 문제 시간 창 제한(VRPTW)에 대해 RLCG는 탐욕 정책 대비 평균적으로 40.9% 감소한 CG 반복 횟수를 기록한다.
  • 두 벤치마크에서 RLCG는 탐욕 정책과 비용이 높은 한 단계 앞서보는 정수계획법 전략보다 총 소요 시간 측면에서 더 빠른 수렴을 달성한다.
  • GNN 기반 상태 표현은 다양한 문제 인스턴스, 특히 항목 수와 차량 수가 다른 경우에도 에이전트의 일반화 능력을 향상시킨다.
  • 커리큘럼 학습 전략은 훈련의 안정성과 샘플 효율성을 크게 향상시켜 다양한 크기와 복잡도의 인스턴스에 걸쳐 효과적인 학습을 가능하게 한다.
  • 제안된 보상 함수는 에이전트가 총 반복 횟수를 최소화하도록 효과적으로 이끌며, 국소 최적화가 아닌 수렴 속도 최적화가 더 뛰어난 성능을 이끌어내는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.