Skip to main content
QUICK REVIEW

[논문 리뷰] Solve Traveling Salesman Problem by Monte Carlo Tree Search and Deep Neural Network

Zhihao Xing, Shikui Tu|arXiv (Cornell University)|2020. 05. 14.
Reinforcement Learning in Robotics참고 문헌 23인용 수 12
한 줄 요약

이 논문은 수작업으로 설계된 특징 또는 레이블이 없는 데이터를 사용하여 TSP를 해결하기 위해 딥 강화학습과 몬테카를로 트리 탐색(MCTS)을 결합한 자기학습 프레임워크를 제안한다. TSP를 트리 탐색 문제로 변환하고, 가치 함수 추정치를 사용해 MCTS를 지도하는 딥 네ural 네트워크를 도입함으로써, 소형에서 중형 크기의 인스턴스에서는 최신 기술 수준(SOTA) 성능을 달성하고 대규모 문제에서는 비교 가능한 결과를 도출하며, 임의의, 군집된, 실제 도메인 그래프에 걸쳐 강력한 일반화 능력을 입증한다.

ABSTRACT

We present a self-learning approach that combines deep reinforcement learning and Monte Carlo tree search to solve the traveling salesman problem. The proposed approach has two advantages. First, it adopts deep reinforcement learning to compute the value functions for decision, which removes the need of hand-crafted features and labelled data. Second, it uses Monte Carlo tree search to select the best policy by comparing different value functions, which increases its generalization ability. Experimental results show that the proposed method performs favorably against other methods in small-to-medium problem settings. And it shows comparable performance as state-of-the-art in large problem setting.

연구 동기 및 목표

  • 수작업으로 설계된 특징이나 지도 학습 데이터에 의존하지 않는 자기학습형 엔드 투 엔드 TSP 프레임워크를 개발한다.
  • 몬테카를로 트리 탐색과 딥 강화학습을 통합하여 조합 최적화 문제에서의 일반화 능력을 향상시킨다.
  • 기존 딥 러닝 모델이 TSP에서 보이는 한계, 즉 대규모 또는 군집된 그래프에서의 낮은 확장성과 불안정성을 해결한다.
  • 임의의, 군집된, 실제 TSPLIB 인스턴스를 포함한 다양한 유형의 그래프에서 방법의 성능을 평가한다.

제안 방법

  • 프레임워크는 TSP를 트리 탐색 문제로 변환하여, 각 경로가 TSP 순회 경로의 후보가 되도록 한다.
  • 딥 네ural 네트워크는 그래프의 구조를 64차원의 노드 특징으로 인코딩하여 수작업 특징 설계를 대체한다.
  • 몬테카를로 트리 탐색은 네트워크의 가치 함수를 사용해 탐색을 지도하고 잠재력이 높은 이동을 선택한다.
  • 강화학습은 자가 생성된 경험을 사용해 네트워크를 훈련시키며, 정책 그래เดียน트 방법을 통해 정책 최적화를 수행한다.
  • MCTS는 각 이동에 대해 400회의 시뮬레이션을 수행하며, 최적의 균형을 확보하기 위해 UCB1 기반 선택과 Cp = 0.5를 사용한다.
  • 합성 TSP 인스턴스의 다양한 크기에서 네트워크를 훈련하기 위해 Adam 옵timizer를 사용하며, 학습률은 1e-4로 설정한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 데이터를 사용하면서도 MCTS를 통합한 딥 강화학습 모델이 지도 학습 및 이전 강화학습 기반 TSP 방법보다 우월한 성능을 내는가?
  • RQ2제안된 방법은 임의의, 군집된, 실제 도메인 그래프를 포함한 다양한 TSP 인스턴스 유형에 대해 얼마나 잘 일반화되는가?
  • RQ3딥 네럴 네트워크와 MCTS를 통합함으로써 대규모 TSP 인스턴스에서 해의 품질과 안정성이 향상되는가?
  • RQ4기준 데이터셋에서 S2V-DQN 및 AttentionTSP와 같은 최신 기술 수준(SOTA) 모델과 비교해 성능가 어떻게 되는가?

주요 결과

  • 임의의 TSP 인스턴스에서, TSP20의 평균 최적성 갭은 1.010, TSP50는 1.063, TSP100은 1.095를 기록하여 Pointer Network를 능가하고 S2V-DQN과 동일한 성능을 보였다.
  • 군집된 그래프에서, 특히 TSP100에서 S2V-DQN보다 더 뛰어난 안정성을 보였으며, 최적성 갭은 1.109로 S2V-DQN의 1.082보다 높았다.
  • 최대 76개의 노드를 가진 실제 도메인 TSPLIB 인스턴스에서, 평균 최적성 갭은 1.003을 기록하여 S2V-DQN의 1.002와 유사한 성능을 보였다.
  • 실제 도메인 인스턴스에서 AttentionTSP는 성능이 급격히 악화되었고, 예를 들어 eil51의 경우 AttentionTSP는 1733, 본 연구 방법은 442를 기록하여 본 연구 방법이 유의미하게 뛰어난 성능을 보였다.
  • TSP50에서 훈련된 모델은 재학습 없이도 TSP100에 잘 일반화되어 1.095의 최적성 갭을 기록하였으며, 이는 강력한 확장성 잠재력을 시사한다.
  • 베이지안 최적화를 통해 MCTS의 최적 Cp 값은 0.5로 도출되었으며, 이는 효과적인 탐색-이용 균형을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.