Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning-based Non-Autoregressive Solver for Traveling Salesman Problems

Yubin Xiao, Di Wang|arXiv (Cornell University)|2023. 08. 01.
Vehicle Routing Optimization MethodsEngineering인용 수 3
한 줄 요약

이 논문은 비자율적(non-autoregressive, NAR) 강화학습(RL)-기반으로 설계된 TSP(TSP)를 위한 첫 번째 솔버인 NAR4TSP를 제안한다. 이는 그래프 신경망(GNN)을 통해 학습 가능한 시작 노드 포인터와 간선 점수를 동시에 최적화하면서 학습 및 추론 과정에서 TSP 제약 조건을 강제로 적용한다. 이 방법은 자가비판 강화학습(self-critical RL)과 NAR 디코딩을 통합함으로써 최신 기술 수준의 해 품질을 달성하고, 더 빠른 추론 속도와 뛰어난 일반화 성능을 확보하여, 합성 및 실세계 TSP 인스턴스에서 기존 모델들을 능가한다.

ABSTRACT

The Traveling Salesman Problem (TSP) is a well-known combinatorial optimization problem with broad real-world applications. Recently, neural networks have gained popularity in this research area because as shown in the literature, they provide strong heuristic solutions to TSPs. Compared to autoregressive neural approaches, non-autoregressive (NAR) networks exploit the inference parallelism to elevate inference speed but suffer from comparatively low solution quality. In this paper, we propose a novel NAR model named NAR4TSP, which incorporates a specially designed architecture and an enhanced reinforcement learning strategy. To the best of our knowledge, NAR4TSP is the first TSP solver that successfully combines RL and NAR networks. The key lies in the incorporation of NAR network output decoding into the training process. NAR4TSP efficiently represents TSP encoded information as rewards and seamlessly integrates it into reinforcement learning strategies, while maintaining consistent TSP sequence constraints during both training and testing phases. Experimental results on both synthetic and real-world TSPs demonstrate that NAR4TSP outperforms five state-of-the-art models in terms of solution quality, inference speed, and generalization to unseen scenarios.

연구 동기 및 목표

  • 기존의 비자율적(NAR) TSP 모델들이 낮은 해 품질, 열악한 일반화 능력, 일관되지 않은 학습-추론 제약 조건으로 인해 약점이 있음을 해결하기 위해.
  • 정확한 솔버로부터의 비용이 많이 드는 진리 레이블에 의존하지 않고도, 강화학습(RL)과 GNN 아키텍처를 통합한 새로운 NAR 모델을 개발하기 위해.
  • 학습 및 추론 과정에서 일관되게 하이퍼턴 사이클 제약 조건을 적용하여 타당하고 고품질의 TSP 해를 보장하기 위해.
  • 표준 두 모듈 강화학습 설정을 하나의 최적화된 모듈로 대체하여 샘플 효율성을 향상시키고 계산 비용을 절감하기 위해.
  • 비자율 모델이 훨씬 더 빠른 추론 속도를 확보하면서도 경쟁 가능한 해 품질을 달성할 수 있음을 입증하여 실시간 의사결정에 적합한 모델을 만들기 위해.

제안 방법

  • 노드 좌표와 상호 간 노드 간격을 입력으로 받아, 간선 점수와 시작 노드를 가리키는 학습 가능한 포인터를 출력하는 수정된 GNN 아키텍처를 제안하여 동적 경로 시작을 가능하게 한다.
  • 학습 및 추론 과정에서 TSP 순차적 제약 조건(즉, 각 노드를 정확히 한 번만 방문하는 순환 경로)을 강제로 적용하는 디코딩 전략을 도입하여 해의 타당성을 보장한다.
  • 모델의 자체 예측 해를 기준선으로 사용하여 정책 기울기를 계산하는 자가비판 강화학습(RL) 전략을 적용하여 학습 안정성과 성능을 향상시킨다.
  • 표준 RL 프레임워크를 개선하기 위해 두 개의 동일한 하위 모듈을 하나의 모듈로 대체하여 메모리 사용량과 학습 시간을 줄이고, 해 품질을 유지하거나 향상시킨다.
  • 디코딩된 TSP 순환 경로의 총 길이를 보상 신호로 사용하여, 종단 간 가속 가능한 방식으로 해 품질을 직접 최적화한다.
  • 추론 과정에서 탐욕적 디코딩을 적용하여 비자율 네트워크의 한 번에 전체 해를 생성하는 특성을 활용해 고속의 해 생성을 달성한다.

실험 결과

연구 질문

  • RQ1강화학습으로 훈련된 비자율 모델이 TSP에 대해 지도학습 기반 모델보다 뛰어난 해 품질을 달성할 수 있는가?
  • RQ2학습 과정에서도 TSP 제약 조건을 적용할 경우, 추론 과정에서만 적용하는 것보다 더 일관되고 고품질의 해를 얻을 수 있는가?
  • RQ3학습 가능한 시작 노드 포인터는 고정된 시작 지점보다 해 품질을 크게 향상시킬 수 있는가?
  • RQ4제안된 개선된 RL 전략은 표준 두 모듈 RL 설정에 비해 효율성과 성능 면에서 어떻게 비교되는가?
  • RQ5NAR4TSP 모델은 크기와 분포가 다양한 미리 보지 못한 TSP 인스턴스에 얼마나 잘 일반화되는가?

주요 결과

  • TSP50 인스턴스에서 NAR4TSP는 평균 해 길이 5.752를 기록하여 기존 최신 기술 수준(NAR) 모델 [13]의 6.398보다 11.23% 향상된 해 품질을 달성한다.
  • 학습 가능한 포인터 메커니즘을 제거할 경우 상대적 성능 저하가 6.34% 발생하여, 이는 루트 최적화에서 핵심적인 역할을 함을 입증한다.
  • 모델이 결정한 시작 노드를 사용한 해 길이는 10,000개 인스턴스에서 최적의 시작 노드와 0.06% 이내로 근접하여 거의 최적의 선택을 함을 시사한다.
  • 개선된 RL 전략은 원래의 두 모듈 RL 설정 대비 GPU 메모리 사용량을 9.89% 감소시키고 학습 시간을 26.36% 단축시키며, 해 품질은 0.48% 향상시킨다.
  • NAR4TSP는 해 품질이 유사한 기존 최신 기술 수준(NAR) 모델 [13] 대비 추론 속도에서 8.7배의 성능 향상을 기록한다. 이는 한 번에 전체 해를 생성하는 NAR 네트워크의 특성 덕분이다.
  • 모델는 다양한 문제 분포와 크기의 미리 보지 못한 TSP 인스턴스에 대해 잘 일반화되어 있으며, 뛰어난 내재적 안정성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.