Skip to main content
QUICK REVIEW

[논문 리뷰] H-TSP: Hierarchically Solving the Large-Scale Travelling Salesman Problem

Xuanhao Pan, Yan Jin|arXiv (Cornell University)|2023. 04. 19.
Transportation and Mobility Innovations인용 수 4
한 줄 요약

H-TSP는 대규모 TSP를 해결하기 위해 상위 수준 정책을 통해 먼저 방문하지 않은 도시 중 소수의 도시를 선택하고, 하위 수준 정책을 사용해 이 도시들에 대한 부분 TSP를 해결하는 계층적 딥 강화학습 프레임워크를 제안한다. 이로 인해 10,000개 노드를 가진 인스턴스에 대해 4초 이내에 최신 기술 수준에 근접한 해를 도출하며, 기존의 최신 기술 기반 검색 방법 대비 추론 시간을 최대 100배까지 단축시킨다.

ABSTRACT

We propose an end-to-end learning framework based on hierarchical reinforcement learning, called H-TSP, for addressing the large-scale Travelling Salesman Problem (TSP). The proposed H-TSP constructs a solution of a TSP instance starting from the scratch relying on two components: the upper-level policy chooses a small subset of nodes (up to 200 in our experiment) from all nodes that are to be traversed, while the lower-level policy takes the chosen nodes as input and outputs a tour connecting them to the existing partial route (initially only containing the depot). After jointly training the upper-level and lower-level policies, our approach can directly generate solutions for the given TSP instances without relying on any time-consuming search procedures. To demonstrate effectiveness of the proposed approach, we have conducted extensive experiments on randomly generated TSP instances with different numbers of nodes. We show that H-TSP can achieve comparable results (gap 3.42% vs. 7.32%) as SOTA search-based approaches, and more importantly, we reduce the time consumption up to two orders of magnitude (3.32s vs. 395.85s). To the best of our knowledge, H-TSP is the first end-to-end deep reinforcement learning approach that can scale to TSP instances of up to 10000 nodes. Although there are still gaps to SOTA results with respect to solution quality, we believe that H-TSP will be useful for practical applications, particularly those that are time-sensitive e.g., on-call routing and ride hailing service.

연구 동기 및 목표

  • 시간 민감한 애플리케이션인 즉각 대응 라우팅 및 라이드셰어링과 같은 분야에서 대규모 TSP 인스턴스를 효율적으로 해결하는 데 도전한다.
  • 큰 행동 공간이나 높은 학습/추론 비용으로 인해 확장성에 어려움을 겪는 기존의 학습 기반 방법의 한계를 극복한다.
  • 반복적 검색에 의존하지 않고도 10,000개 노드까지 일반화 가능한 종단 간, 확장 가능한 딥 강화학습 프레임워크를 개발한다.
  • 추론 중 하위 수준 정책을 LKH-3과 같은 고성능 해법기로 교체할 수 있도록 유연한 해법 품질과 추론 속도의 상호 보완적 조정을 가능하게 한다.

제안 방법

  • TSP 해법 구축 과정을 두 수준의 계층적 구조로 분해한다: 상위 수준 정책이 방문하지 않은 도시 중 최대 200개의 도시를 다음 부분 루트에 포함할 대상으로 선택한다.
  • 하위 수준 정책이 선택된 도시 집합에 대해 TSP 루트를 구성하고, 창고에서 시작하는 기존 부분 경로에 통합한다.
  • 해법 품질과 수렴 속도를 최적화하기 위해 두 정책을 함께 딥 강화학습으로 훈련시킨다.
  • 각 단계에서 효과적인 문제 크기를 줄이는 분할 정복 전략을 사용하여 10,000개 노드 인스턴스까지의 확장성을 달성한다.
  • 훈련 안정성 향상과 성능 향상을 위해 k-NN 및 방문한 프ragment 특징을 함께 사용하는 웜업 훈련 전략을 도입한다.
  • 추론 중에 학습된 하위 수준 정책을 LKH-3로 대체하여 해법 품질을 향상시키면서도 빠른 추론 속도를 유지한다.

실험 결과

연구 질문

  • RQ1계층적 딥 강화학습 프레임워크는 최대 10,000개 노드를 가진 TSP 인스턴스에 대해 경쟁력 있는 해법 품질을 유지하면서도 확장 가능한가?
  • RQ2해법 품질과 추론 시간 측면에서, 계층적 접근 방식은 최신 기술 기반 검색 및 학습 기반 TSP 해법기와 비교해 어떻게 성능을 내는가?
  • RQ3상위 수준 정책과 하위 수준 정책 중 어느 것이 전체 해법 품질에 더 큰 기여를 하는가? 이 정책들은 독립적으로 향상되거나 교체 가능한가?
  • RQ4웜업 훈련과 공동 훈련을 특징으로 하는 제안된 훈련 전략이 모델의 안정성과 성능 향상에 얼마나 기여하는가?
  • RQ5학습된 하위 수준 정책을 LKH-3과 같은 고성능 휠씬 해법기로 교체함으로써 실용적 구현에 적합하게 프레임워크를 조정할 수 있는가? 이 경우 속도 손실가 발생하지 않는가?

주요 결과

  • H-TSP는 10,000개 노드 TSP 인스턴스에서 최적해와의 격차가 3.42%로, 최신 기술 기반 Att-GCN+MCTS 방법(3.22% 격차)과 유사한 성능을 보이며, 추론 시간을 395.85초에서 단 3.32초로 단축시켰다.
  • 프레임워크는 미리 보지 않은 TSP 인스턴스에도 잘 일반화되며, 50,000개 노드 인스턴스에서 격차가 7.10%로 유지되며, 1,000에서 50,000개 노드 사이에서 성능이 안정적이다.
  • 절단 분석 결과, 하위 수준 정책이 상위 수준 정책보다 해법 품질에 더 큰 영향을 미치며, 웜업 단계가 훈련 과정에서 가장 중요한 구성 요소임을 확인했다.
  • 학습된 하위 수준 정책을 LKH-3로 교체하면 해법 품질이 향상되며(예: 10,000개 노드 인스턴스에서 격차가 7.32%에서 5.57%로 감소), 同시에 빠른 추론 속도(27.94초 대비 Att-GCN+MCTS의 395.85초)를 유지한다.
  • 웜업 훈련이 없을 경우 최적해 격차가 20.29%포인트 증가(6.76%에서 27.05%로)하여, 이는 웜업 훈련이 훈련 안정성에 매우 중요하다는 것을 시사한다.
  • k-NN 및 방문한 프ragment 특징의 조합은 각각 성능 향상에 0.93 및 0.66%포인트 기여하여, 표현 학습에서의 가치를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.