Skip to main content
QUICK REVIEW

[논문 리뷰] Generalization in Deep RL for TSP Problems via Equivariance and Local Search

Wenbin Ouyang, Yisen Wang|arXiv (Cornell University)|2021. 10. 07.
Metaheuristic Optimization Algorithms Research참고 문헌 26인용 수 6
한 줄 요약

이 논문은 동치성, 혼합 국소 탐색, 커리큘럼 학습을 통해 일반화 능력을 향상시키는 TSP(최소 이동 거리 문제)를 위한 딥 강화학습 프레임워크인 eMAGIC를 제안한다. 소규모 인스턴스(최대 50개 도시)에서 훈련함으로써, eMAGIC는 최대 1000개 도시의 큰 규모의 랜덤 및 실제 TSP 인스턴스에서 최신 기술 성능을 달성하며, 큰 TSPLIB 인스턴스에서 일반화 갭이 단지 3.40%에 그친다.

ABSTRACT

Deep reinforcement learning (RL) has proved to be a competitive heuristic for solving small-sized instances of traveling salesman problems (TSP), but its performance on larger-sized instances is insufficient. Since training on large instances is impractical, we design a novel deep RL approach with a focus on generalizability. Our proposition consisting of a simple deep learning architecture that learns with novel RL training techniques, exploits two main ideas. First, we exploit equivariance to facilitate training. Second, we interleave efficient local search heuristics with the usual RL training to smooth the value landscape. In order to validate the whole approach, we empirically evaluate our proposition on random and realistic TSP problems against relevant state-of-the-art deep RL methods. Moreover, we present an ablation study to understand the contribution of each of its component

연구 동기 및 목표

  • 계산 비용으로 인해 큰 TSP 인스턴스에서 훈련이 불가능한 데도 불구하고, 딥 RL 솔버의 일반화 능력이 열 劣한 문제를 해결한다.
  • 훈련 시 사용한 인스턴스보다 더 큰 인스턴스에서 성능이 열 劣한 기존의 RL 기반 TSP 솔버의 한계를 극복한다.
  • 소규모 인스턴스에서 훈련하고 큰 인스턴스를 효과적으로 해결할 수 있는 확장 가능하고 일반화 가능한 딥 RL 프레임워크를 개발한다.
  • 구조적 불변성과 동치성, 국소 탐색, 커리큘럼 학습의 조합이 조합 최적화에서 일반화 능력을 향상시키는 방식을 조사한다.
  • 합성 및 실제 세계 TSP 벤치마크, 특히 최대 1002개 도시의 TSPLIB 인스턴스에서 제안된 방법의 효과성을 입증한다.

제안 방법

  • 공간 대칭성에 대해 일관된 행동을 보장하기 위해 상대적 도시 위치와 순열 불변 처리를 사용하여 모델에 동치성을 도입한다.
  • 효율적인 국소 탐색 휴리스틱(예: 2-opt)을 딥 RL 훈련과 번갈아가며 적용하여 보상 지도를 부드럽게 하고 정책 최적화를 향상시킨다.
  • 훈련 중 정책 그래ient 추정의 분산을 줄이기 위해 새로운 정책 롤아웃 기반을 제안한다.
  • 소규모(예: 20개 도시)에서 대규모(예: 1000개 도시)로 점진적으로 훈련 인스턴스 크기를 증가시키는 커리큘럼 학습을 적용하여 훈련 안정성과 일반화 능력을 향상시킨다.
  • TSP 입력을 효과적으로 처리하기 위해 그래프 신경망(GNN), 다층 퍼셉트론(MLP), 어텐션 메커니즘을 조합한 하이브리드 모델 아키텍처를 설계한다.
  • 국소 탐색에서 향상된 해를 타겟으로 사용하여 수정된 정책 그래ient 업데이트를 적용함으로써 정책 수렴과 해 품질을 향상시킨다.
Figure 1: Model Architecture of eMAGIC
Figure 1: Model Architecture of eMAGIC

실험 결과

연구 질문

  • RQ1모델 아키텍처에서의 동치성이 다양한 인스턴스 크기 간 TSP에 대한 딥 RL 솔버의 일반화 능력을 향상시키는가?
  • RQ2RL 훈련과 국소 탐색을 번갈아 적용함으로써 최적화 지도가 얼마나 부드러워지고 정책 학습이 향상되는가?
  • RQ3커리큘럼 학습이 소규모 인스턴스에서 훈련된 RL 기반 TSP 솔버의 일반화 능력을 얼마나 향상시키는가?
  • RQ4제안된 정책 롤아웃 기반은 기존 기반보다 정책 그래ient 추정의 분산을 얼마나 줄이는가?
  • RQ5소규모 TSP 인스턴스(≤50개 도시)에서 훈련된 모델이 랜덤 및 실제 설정에서 최대 1000개 도시의 대규모 TSP 문제에서 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • eMAGIC는 큰 실제 TSPLIB 인스턴스(400–1002개 도시)에서 최적해와의 평균 갭이 3.40%로, 다른 학습 기반 방법보다 뚜렷이 뛰어난 성능을 기록한다.
  • TSP-1000 인스턴스에서 eMAGIC는 평균 갭 7.05%를 기록했으며, TSP-500(6.01%)에서의 갭 증가율이 단지 1.2%에 그쳐 크기 간 강력한 일반화 능력을 보여준다.
  • 제거 실험 결과, 동치성을 제거할 경우 TSP-1000에서 평균 갭이 1.4% 증가하여, 이는 동치성이 성능에 핵심적인 역할을 한다는 것을 입증한다.
  • 자기 비평 기반을 정책 롤아웃 기반으로 대체할 경우 TSP-1000에서 평균 갭이 1.1% 증가하여, 정책 롤아웃 기반의 훈련 분산 감소 기여를 확인한다.
  • 훈련 중 국소 탐색을 제거할 경우 TSP-1000에서 평균 갭이 1.6% 증가하여, 국소 탐색이 후처리를 넘어서 정책 학습을 향상시킨다는 것을 보여준다.
  • eMAGIC는 실제 세계 TSP 인스턴스로의 일반화가 효과적으로 이루어져, 소규모 TSPLIB 인스턴스(50–199개 도시)에서 0.46% 갭을 기록하며, 이 범위에서 모든 다른 학습 기반 솔버를 능가한다.
Figure 2: Detailed Architecture of GNN
Figure 2: Detailed Architecture of GNN

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.