Skip to main content
QUICK REVIEW

[논문 리뷰] An Improved Reinforcement Learning Algorithm for Learning to Branch

Qingyu Qu, Xijun Li|arXiv (Cornell University)|2022. 01. 17.
Machine Learning and Data Classification인용 수 10
한 줄 요약

이 논문은 혼합정수선형계획법(MILP)에서 분기 전략을 학습하기 위한 새로운 강화학습(RL) 알고리즘을 제안한다. 이 알고리즘은 애자일러닝과 자기 향상형 RL을 결합한다. 강력한 분기 기반의 시연 데이터를 활용하고, 전문가 및 자기 생성 데이터의 비율을 동적으로 조절하는 우선순위 기반 재생 버퍼를 사용함으로써, 초기 학습을 가속화하고 우수한 Q-네트워크를 통해 안정성을 향상시킨다. 이 방법은 벤치마크 문제에서 최고 성능을 기록하며, 히وري스틱 규칙과 SOTA 애자일러닝 방법보다 최대 35.88% 높은 성능을 달성한다.

ABSTRACT

Most combinatorial optimization problems can be formulated as mixed integer linear programming (MILP), in which branch-and-bound (B\&B) is a general and widely used method. Recently, learning to branch has become a hot research topic in the intersection of machine learning and combinatorial optimization. In this paper, we propose a novel reinforcement learning-based B\&B algorithm. Similar to offline reinforcement learning, we initially train on the demonstration data to accelerate learning massively. With the improvement of the training effect, the agent starts to interact with the environment with its learned policy gradually. It is critical to improve the performance of the algorithm by determining the mixing ratio between demonstration and self-generated data. Thus, we propose a prioritized storage mechanism to control this ratio automatically. In order to improve the robustness of the training process, a superior network is additionally introduced based on Double DQN, which always serves as a Q-network with competitive performance. We evaluate the performance of the proposed algorithm over three public research benchmarks and compare it against strong baselines, including three classical heuristics and one state-of-the-art imitation learning-based branching algorithm. The results show that the proposed algorithm achieves the best performance among compared algorithms and possesses the potential to improve B\&B algorithm performance continuously.

연구 동기 및 목표

  • 강화학습 기반 분기 학습에서 느린 탐색과 높은 변동성을 해결하기 위해 전문가 시연 데이터를 활용해 학습을 가속화한다.
  • 우선순위 저장 메커니즘을 사용해 시연 데이터와 자기 생성 데이터의 혼합 비율을 동적으로 제어함으로써 학습 안정성과 성능을 향상시킨다.
  • 큰 행동 공간을 가진 고차원 상태 및 행동 공간에서의 안정성을 향상시키기 위해 더 우수한 Q-네트워크를 도입한다.
  • 분기-완전법(Branch-and-Bound)을 사용한 MILP 문제 해결에서 기존 히وري스틱 및 애자일러닝 기반 베이스라인을 능가하는 성능을 달성한다.

제안 방법

  • 알고리즘은 강화학습 에이전트의 초기 학습을 가속화하기 위해 강력한 분기 기반의 시연 데이터를 사용해 사전 학습한다.
  • 우선순위 기반 경험 재생 버퍼는 학습 중 전문가 시연 데이터와 자기 생성 데이터 간 혼합 비율을 자동으로 제어한다.
  • 더 나은 Q-네트워크를 갖춘 더블 디큐엔(DQN) 기반 아키텍처를 사용하여, 학습 전반에 걸쳐 경쟁적인 성능 유지를 한다.
  • 에이전트는 현재 심플렉스 테이블로와 분기 결정에서 유도된 상태 특징을 기반으로 변수 선택을 마르코프 결정 과정(MDP)으로 모델링한다.
  • 성능 향상에 따라 학습 과정이 시연 지도 학습에서 자기 탐색 기반 정교화로 점차 전환된다.
  • 이 알고리즘은 이중 적분과 노드 수를 성능 지표로 사용해 세 가지 공개된 MILP 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1시연 데이터가 MILP 분기 학습을 위한 강화학습 에이전트의 학습을 상당히 가속화할 수 있는가?
  • RQ2저품질 데이터로 인한 성능 저하를 방지하기 위해 학습 중 전문가 시연 데이터와 자기 생성 데이터의 비율을 효과적이고 자동으로 제어할 수 있는가?
  • RQ3더 나은 Q-네트워크가 큰 행동 공간을 가진 고차원 MILP 환경에서 학습 안정성과 성능 향상에 기여할 수 있는가?
  • RQ4애자일러닝과 자기 향상형 RL을 융합하면 순수 애자일러닝 또는 전통적 히وري스틱보다 더 높은 성능을 달성할 수 있는가?

주요 결과

  • 제안된 알고리즘은 세 벤치마크 모두에서 최고 점수를 기록했다: Balanced Item Placement에서 32,547,931점, Workload Apportionment에서 32,446,178점, Anonymous Problem에서 32,446,178점.
  • Balanced Item Placement 벤치마크에서 100개의 인스턴스 중 42개에서 승리했으며, SOTA 애자일러닝 방법(29승)과 모든 히وري스틱 베이스라인을 크게 앞서며 성능을 뛰어넘었다.
  • Balanced Item Placement 벤치마크에서 애자일러닝 베이스라인 대비 이중 적분을 최대 35.88% 감소시켰다.
  • 추이 분석 결과, 더 나은 Q-네트워크와 우선순위 기반 재생이 안정적이고 효과적인 학습을 위해 필수적임을 확인했으며, 기본적인 더블 DQN 기반 모델은 효과적으로 학습에 실패했다.
  • 이중 경계 곡선 분석 결과, 제안된 방법은 모든 베이스라인보다 더 빨리 최적 해에 도달했고, 더 적은 노드 수로 성능을 달성했다.
  • 학습 과정이 안정화되고 시간이 지남에 따라 성능 향상 잠재력이 지속적으로 증가함을 입증했으며, 제안된 구성 요소들이 이에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.