Skip to main content
QUICK REVIEW

[논문 리뷰] DAN: Decentralized Attention-based Neural Network to Solve the MinMax Multiple Traveling Salesman Problem.

Yuhong Cao, Zhanhong Sun|arXiv (Cornell University)|2021. 09. 09.
Transportation and Mobility Innovations참고 문헌 18인용 수 5
한 줄 요약

이 논문은 MinMax 다중 여행판매원 문제(mTSP)를 해결하기 위해 파rameter 공유를 통한 다중 에이전트 강화학습과 트랜스포머 아키텍처를 활용한 탈중앙화된 어텐션 기반 신경망인 DAN을 제안한다. 에이전트들이 상대방의 행동을 예측하여 공동으로 최장 순회 길이를 최소화할 수 있도록 설계되어 있으며, 대규모 인스턴스에서 최신 솔버들을 능가하면서도 낮은 계산 시간을 유지한다.

ABSTRACT

The multiple traveling salesman problem (mTSP) is a well-known NP-hard problem with numerous real-world applications. In particular, this work addresses MinMax mTSP, where the objective is to minimize the max tour length (sum of Euclidean distances) among all agents. The mTSP is normally considered as a combinatorial optimization problem, but due to its computational complexity, search-based exact and heuristic algorithms become inefficient as the number of cities increases. Encouraged by the recent developments in deep reinforcement learning (dRL), this work considers the mTSP as a cooperative task and introduces a decentralized attention-based neural network method to solve the MinMax mTSP, named DAN. In DAN, agents learn fully decentralized policies to collaboratively construct a tour, by predicting the future decisions of other agents. Our model relies on the Transformer architecture, and is trained using multi-agent RL with parameter sharing, which provides natural scalability to the numbers of agents and cities. We experimentally demonstrate our model on small- to large-scale mTSP instances, which involve 50 to 1000 cities and 5 to 20 agents, and compare against state-of-the-art baselines. For small-scale problems (fewer than 100 cities), DAN is able to closely match the performance of the best solver available (OR Tools, a meta-heuristic solver) given the same computation time budget. In larger-scale instances, DAN outperforms both conventional and dRL-based solvers, while keeping computation times low, and exhibits enhanced collaboration among agents.

연구 동기 및 목표

  • NP-난이도 성질로 인해 정확한 해법과 휴리스틱 방법의 계산 비효율성 문제를 해결하기 위해.
  • 에이전트들이 최대 순회 길이를 최소화해야 하는 협동적 mTSP 해결을 위한 확장 가능하고 탈중앙화된 학습 접근법을 개발하기 위해.
  • 중앙 집중적 조율 없이도 상대방의 향후 결정을 예측함으로써 협동 계획을 향상시키기 위해.
  • 동일한 계산 예산 내에서 최신 솔버(예: OR Tools)와 비교해 성능이 유사하거나 뛰어나도록 하기 위해.
  • 소규모(50~100개 도시) 및 대규모(최대 1000개 도시) mTSP 인스턴스에 걸쳐 확장성과 강건성을 입증하기 위해.

제안 방법

  • mTSP의 에이전트 의사결정에서 장거리 의존성을 모델링하기 위해 트랜스포터 아키텍처를 적응시켰다.
  • 에이전트 수와 도시 수의 변화에 대비해 확장성을 확보하기 위해 파rameter 공유를 통한 다중 에이전트 강화학습으로 에이전트를 훈련시켰다.
  • 각 에이전트가 다른 이의 향후 행동을 예측하여 순회 구성에 협력할 수 있도록 탈중앙화된 정책을 구현했다.
  • 계획 과정에서 관련 도시와 다른 에이전트의 잠재적 움직임에 집중할 수 있도록 어텐션 메커니즘을 사용했다.
  • 모든 에이전트의 최대 순회 길이를 최소화하는 데 초점을 맞춰 보상 함수를 정의하여 MinMax 목표와 일치시켰다.
  • 중앙 집중적 제어 없이도 공동 정책을 최적화하기 위해 딥 강화학습을 통해 엔드 투 엔드로 훈련시켰다.

실험 결과

연구 질문

  • RQ1탈중앙화되고 어텐션 기반인 딥 강화학습 모델은 높은 확장성으로 MinMax mTSP를 효과적으로 해결할 수 있는가?
  • RQ2소규모 mTSP 인스턴스에서 제안된 DAN 모델의 성능은 OR Tools와 같은 정확한 해법 및 휴리스틱 솔버와 비교해 어떻게 되는가?
  • RQ3최대 1000개 도시와 20명의 에이전트를 포함한 대규모 mTSP 인스턴스에서 모델은 강력한 성능과 협업 품질을 유지하는가?
  • RQ4협동적 mTSP 해결에서 탈중앙화된 에이전트 간의 협업을 향상시키기 위해 어텐션 기반 행동 예측이 얼마나 기여하는가?
  • RQ5다중 에이전트 강화학습에서의 파rameter 공유가 재학습 없이도 다른 수의 에이전트와 도시에 대해 일반화를 가능하게 하는가?

주요 결과

  • 100개 도시 미만의 소규모 mTSP 인스턴스에서 DAN은 동일한 계산 시간 예산 내에서 OR Tools(최신 메타휴리스틱 솔버)의 성능에 매우 가까운 결과를 기록했다.
  • 최대 1000개 도시와 20명의 에이전트를 포함한 대규모 mTSP 인스턴스에서 DAN은 기존의 전통적 솔버와 기존의 딥 강화학습 기반 접근법을 모두 능가했다.
  • 낮은 계산 시간을 유지하여 실세계 적용에 실용적인 효율성을 보였다.
  • 어텐션 메커니즘이 다른 에이전트의 향후 결정을 예측하고 적응함으로써 에이전트 간 효과적인 협업을 가능하게 했다.
  • 파rameter 공유 덕분에 모델은 다양한 수의 에이전트와 도시에 대해 일반화할 수 있었으며, 이는 확장성을 향상시켰다.
  • DAN의 탈중앙화된 성격 덕분에 중앙 집중적 조율 없이도 강건하고 확장 가능하며 협동적인 순회 계획이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.