Skip to main content
QUICK REVIEW

[논문 리뷰] DAN: Decentralized Attention-based Neural Network for the MinMax Multiple Traveling Salesman Problem

Yuhong Cao, Zhanhong Sun|arXiv (Cornell University)|2021. 09. 09.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 다수의 에이전트가 참여하는 MinMax 다중 여행판매원 문제(mTSP)를 해결하기 위해 파rameter 공유를 통한 다중 에이전트 강화학습을 사용하는 탈중앙화된 어텐션 기반 신경망인 DAN을 제안한다. 에이전트들이 자체 어텐션 및 상호 어텐션 메커니즘을 통해 암묵적으로 협력함으로써, DAN은 몇 초 내로 거의 최적의 해를 달성하며, 대규모 mTSP 인스턴스(100~1000개의 도시, 5~20명의 에이전트)에서 OR Tools와 같은 최첨단 솔버를 능가한다. 이는 계획 시간이 훨씬 낮은 수준에서 달성된다.

ABSTRACT

The multiple traveling salesman problem (mTSP) is a well-known NP-hard problem with numerous real-world applications. In particular, this work addresses MinMax mTSP, where the objective is to minimize the max tour length among all agents. Many robotic deployments require recomputing potentially large mTSP instances frequently, making the natural trade-off between computing time and solution quality of great importance. However, exact and heuristic algorithms become inefficient as the number of cities increases, due to their computational complexity. Encouraged by the recent developments in deep reinforcement learning (dRL), this work approaches the mTSP as a cooperative task and introduces DAN, a decentralized attention-based neural method that aims at tackling this key trade-off. In DAN, agents learn fully decentralized policies to collaboratively construct a tour, by predicting each other's future decisions. Our model relies on the Transformer architecture and is trained using multi-agent RL with parameter sharing, providing natural scalability to the numbers of agents and cities. Our experimental results on small- to large-scale mTSP instances ($50$ to $1000$ cities and $5$ to $20$ agents) show that DAN is able to match or outperform state-of-the-art solvers while keeping planning times low. In particular, given the same computation time budget, DAN outperforms all conventional and dRL-based baselines on larger-scale instances (more than 100 cities, more than 5 agents), and exhibits enhanced agent collaboration. A video explaining our approach and presenting our results is available at \url{https://youtu.be/xi3cLsDsLvs}.

연구 동기 및 목표

  • 동적 로봇 환경에서 대규모 MinMax mTSP 인스턴스를 신속하고 효율적으로 해결하는 데 도전한다.
  • 정확한 해법과 휴리스틱 해법의 한계를 극복하여, 인스턴스 크기가 커질수록 시간 제약이 엄격해지는 상황에서 실용성이 떨어지게 된다.
  • 다양한 수의 에이전트와 도시에 대해 확장 가능하고 탈중앙화된 딥 강화학습 방법을 개발하여 다수의 에이전트 간 협력적 실시간 계획을 가능하게 한다.
  • 기존의 딥 강화학습 및 메타휴리스틱 기반 베이스라인 대비 mTSP에 대해 해의 질과 계획 효율성을 향상시킨다.

제안 방법

  • MinMax mTSP를 협동적 다중 에이전트 강화학습 프레임워크 내의 순차적 의사결정 문제로 수식화한다.
  • 도시와 에이전트를 별도로 처리하는 인코더를 갖춘 트랜스포머 기반 신경망 아키텍처를 설계하여, 에이전트 간 상호작용과 도시-에이전트 간 의존성에 기반한 어텐션 기반 모델링을 가능하게 한다.
  • 에이전트와 도시 간 상호작용을 모델링하기 위해 도시-에이전트 인코더를 도입하여, 협업 능력 향상과 향후 의사결정의 암묵적 예측을 가능하게 한다.
  • 파rameter 공유를 통한 다중 에이전트 강화학습으로 모델을 훈련시켜, 임의의 수의 에이전트와 도시에까지 확장 가능성을 확보한다.
  • 해의 질과 추론 속도의 균형을 맞추기 위해 탐욕적 추론과 샘플링 추론 변형을 활용한다.
  • 자기 어텐션 메커니즘을 활용하여 에이전트들이 탈중앙화된 방식으로 전반적인 상태를 이해하고 다른 에이전트의 향후 행동을 예측할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1탈중앙화된 딥 강화학습 접근법이 대규모 MinMax mTSP 인스턴스에서 전통적 솔버보다 더 높은 해의 질과 더 낮은 계획 시간을 달성할 수 있는가?
  • RQ2에이전트 간 상호작용과 도시-에이전트 간 의존성에 대한 어텐션 기반 모델링이 mTSP에서 에이전트 간 협업을 어떻게 향상시키는가?
  • RQ3다중 에이전트 훈련에서의 파라미터 공유가 다양한 수의 에이전트와 도시에서 확장성과 성능을 얼마나 향상시키는가?
  • RQ4시간 제약 조건 하에서 제안된 어텐션 메커니즘이 일반적인 인코더-디코더 아키텍처보다 mTSP 계획에서 뛰어난 성능을 보이는가?

주요 결과

  • 100개 이상의 도시와 5개 이상의 에이전트를 포함한 mTSP 인스턴스에서, DAN은 동일한 시간 예산 내에서 OR Tools 대비 10% 높은 해의 질을 달성한다.
  • 500개 이상의 도시를 포함한 인스턴스에서는 OR Tools가 1800초 이내에 실용적이지 않게 되지만, DAN의 탐욕적 변형은 100초 이내에 고품질의 해를 생성한다.
  • DAN의 계획 시간은 도시 수에 따라 선형적으로 증가하지만, OR Tools는 계산 시간이 지수적으로 증가하는 경향을 보인다.
  • 10명의 에이전트를 포함한 mTSP 인스턴스에서 DAN은 LKH3(정확한 솔버)의 해의 질에 4% 이내로 접근하지만, 훨씬 더 빠른 속도로 작동한다.
  • DAN에 에이전트 및 도시-에이전트 인코더를 추가함으로써, 일반적인 도시 인코더-디코더 아키텍처만을 사용하는 모델보다 훨씬 뛰어난 성능을 달성한다.
  • 대부분의 mTSP 인스턴스에서 두 가지 최근의 dRL 기반 방법보다 DAN이 해의 질에서 뛰어나며, 특히 대규모 설정에서 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.