Skip to main content
QUICK REVIEW

[論文レビュー] DAN: Decentralized Attention-based Neural Network to Solve the MinMax Multiple Traveling Salesman Problem.

Yuhong Cao, Zhanhong Sun|arXiv (Cornell University)|Sep 9, 2021
Transportation and Mobility Innovations参考文献 18被引用数 5
ひとこと要約

本稿では、Transformerアーキテクチャとパラメータ共有を用いたマルチエージェント強化学習を組み合わせた分散型アテンションベースのニューラルネットワーク(DAN)を提案する。この手法は、Minimax複数巡回セールスマン問題(mTSP)を解くために設計されており、エージェントが互いの行動を予測することで共同で最長巡回路長を最小化する。大規模なインスタンスにおいても、最先端のソルバーより優れた性能を発揮しながら、計算時間も低く抑えられる。

ABSTRACT

The multiple traveling salesman problem (mTSP) is a well-known NP-hard problem with numerous real-world applications. In particular, this work addresses MinMax mTSP, where the objective is to minimize the max tour length (sum of Euclidean distances) among all agents. The mTSP is normally considered as a combinatorial optimization problem, but due to its computational complexity, search-based exact and heuristic algorithms become inefficient as the number of cities increases. Encouraged by the recent developments in deep reinforcement learning (dRL), this work considers the mTSP as a cooperative task and introduces a decentralized attention-based neural network method to solve the MinMax mTSP, named DAN. In DAN, agents learn fully decentralized policies to collaboratively construct a tour, by predicting the future decisions of other agents. Our model relies on the Transformer architecture, and is trained using multi-agent RL with parameter sharing, which provides natural scalability to the numbers of agents and cities. We experimentally demonstrate our model on small- to large-scale mTSP instances, which involve 50 to 1000 cities and 5 to 20 agents, and compare against state-of-the-art baselines. For small-scale problems (fewer than 100 cities), DAN is able to closely match the performance of the best solver available (OR Tools, a meta-heuristic solver) given the same computation time budget. In larger-scale instances, DAN outperforms both conventional and dRL-based solvers, while keeping computation times low, and exhibits enhanced collaboration among agents.

研究の動機と目的

  • NP困難な性質を持つ大規模なMinimax mTSPに対して、正確法やヒューリスティック法の計算非効率性を解消すること。
  • エージェントが最長巡回路長を最小化する協調的でスケーラブルな分散型学習手法を構築すること。
  • 中央集権的な調整なしに、エージェント同士が互いの将来の意思決定を予測することで協調的計画を向上させること。
  • 同じ計算予算下で、最先端のソルバーよりも同等または優れた性能を達成すること(例:OR Tools)。
  • 小規模(50〜100都市)および大規模(最大1000都市)のmTSPインスタンスにおいて、スケーラビリティとロバストネスを示すこと。

提案手法

  • mTSPにおけるエージェント意思決定の長距離依存関係をモデル化するため、Transformerアーキテクチャを適応する。
  • パラメータ共有を用いたマルチエージェント強化学習でエージェントを訓練し、エージェント数や都市数の変動に対してもスケーラビリティを確保する。
  • 各エージェントが他のエージェントの将来の行動を予測することで、巡回ルートの構築を調整する分散型ポリシーを実装する。
  • 計画段階で、関連のある都市や他のエージェントの潜在的行動に注目できるアテンション機構を用いる。
  • 全エージェント間の最大巡回路長を最小化するように報酬関数を定義し、Minimax目的関数と整合させる。
  • 中央集権的制御なしに、ジョイントポリシーを最適化するため、エンドツーエンドで深層強化学習を訓練する。

実験結果

リサーチクエスチョン

  • RQ1分散型でアテンションベースの深層強化学習モデルは、高いスケーラビリティを備えてMinimax mTSPを効果的に解けるか?
  • RQ2小規模なmTSPインスタンスにおいて、提案されたDANモデルはOR Toolsのような正確法やヒューリスティックソルバーと比較してどの程度の性能を示すか?
  • RQ3最大1000都市および20エージェントを含む大規模なmTSPインスタンスにおいて、モデルは高い性能と協調性を維持できるか?
  • RQ4アテンションベースの行動予測は、協調的mTSP解決における分散型エージェント間の連携をどの程度向上させるか?
  • RQ5マルチエージェント強化学習におけるパラメータ共有は、再訓練なしに異なるエージェント数や都市数に一般化可能か?

主な発見

  • 小規模なmTSPインスタンス(100都市未満)において、DANは計算時間予算が同じ条件下で、最先端のメタヒューリスティックソルバであるOR Toolsとほぼ同等の性能を達成した。
  • 大規模なmTSPインスタンス(最大1000都市および20エージェント)において、DANは従来のソルバーや既存の深層強化学習ベースの手法を上回った。
  • モデルは低計算時間維持を示し、実世界への導入に向けた実用的効率性を示した。
  • アテンション機構により、エージェント同士が互いの将来の意思決定を予測・適応可能となり、効果的な協調が可能になった。
  • パラメータ共有により、異なるエージェント数や都市数に一般化可能となり、スケーラビリティが向上した。
  • DANの分散型アーキテクチャにより、中央集権的調整なしに、ロバストでスケーラブルかつ協調的な巡回ルート計画が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。