Skip to main content
QUICK REVIEW

[論文レビュー] Attention Solves Your TSP, Approximately

Wouter Kool, Herke van Hoof|arXiv (Cornell University)|Mar 22, 2018
Vehicle Routing Optimization Methods被引用数 18
ひとこと要約

この論文は、REINFORCEに動的ベースラインを用いた効率的な学習により、エンド・トゥ・エンドで近似的に最適な巡回路を構築できる、グラフ自己注意ネットワークに基づくヒューリスティクスを提案する。20ノードのインスタンスにおいて、最適性ギャップを0.32%まで低減し、先行する学習可能なヒューリスティクスを著しく上回る性能を発揮する。

ABSTRACT

The development of efficient (heuristic) algorithms for practical combinatorial optimization problems is costly, so we want to automatically learn them instead. We show the feasibility of this approach on the important Travelling Salesman Problem (TSP). We learn a heuristic algorithm that uses a Neural Network policy to construct a tour. As an alternative to the Pointer Network, our model is based entirely on (graph) attention layers and is invariant to the input order of the nodes. We train the model efficiently using REINFORCE with a simple and robust baseline based on a deterministic (greedy) rollout of the best policy so far. We significantly improve over results from previous works that consider learned heuristics for the TSP, reducing the optimality gap for a single tour construction from 1.51% to 0.32% for instances with 20 nodes, from 4.59% to 1.71% for 50 nodes and from 6.89% to 4.43% for 100 nodes. Additionally, we improve over a recent Reinforcement Learning framework for two variants of the Vehicle Routing Problem (VRP).

研究の動機と目的

  • 入力ノード順序に依存しないエンド・トゥ・エンドで学習可能なニューラルヒューリスティクスをTSP用に開発すること。
  • 巡回路構築における最適性ギャップを低減することで、既存の学習可能なヒューリスティクスを改善すること。
  • 強力で適応可能なベースラインを用いたREINFORCEによるポリシー・ネットワークの効率的学習を可能にすること。
  • この手法の有効性を車両経路計画問題(VRP)の変種へと拡張すること。

提案手法

  • モデルはグラフ自己注意ネットワーク(GAT)アーキテクチャを用い、ノード埋め込みを処理し、巡回路構築のための候補ノードに注目を向ける。
  • ポリシー・ネットワークは、到達した最良の決定的巡回路を用いる動的ベースラインを用いたREINFORCEで訓練される。
  • 注目メカニズムに基づくアーキテクチャのおかげで、モデルは順列不変性を有し、入力ノード順序に関係なく一貫した予測を保証する。
  • 巡回路の構築は段階的に進行し、モデルは未訪問ノードに対する注目スコアに基づいて次の都市を選択する。
  • 訓練の目的関数は、負の期待巡回路長を最小化することで、ポリシーが高品質な巡回路を学習するよう促進する。
  • 本手法はTSPおよび2つのVRP変種において評価され、TSPを越えた一般化能力を示している。

実験結果

リサーチクエスチョン

  • RQ1純粋に注目に基づくニューラルネットワークは、入力順序に依存しない競争力のあるTSPヒューリスティクスを学習できるか?
  • RQ2REINFORCE訓練において動的ベースラインを使用することで、静的またはランダムベースラインと比較して収束が速くなり、性能が向上するか?
  • RQ3異なるインスタンスサイズにおいて、学習されたヒューリスティクスは、先行する学習可能および古典的ヒューリスティクスと比較して最適性ギャップでどのように差をつけるか?
  • RQ4本手法は、車両経路計画問題(VRP)の変種を効果的に解けるように拡張できるか?

主な発見

  • 20ノードのTSPインスタンスにおいて、最適性ギャップは、先行研究の1.51%から0.32%にまで低減された。
  • 50ノードのインスタンスでは、最適性ギャップが4.59%から1.71%にまで低減された。
  • 100ノードのインスタンスでは、最適性ギャップが6.89%から4.43%にまで低減された。
  • 本手法はTSPにおいて先行する学習可能なヒューリスティクスを上回り、2つのVRP変種においても結果を改善した。
  • REINFORCE訓練における動的ベースラインの使用は、安定的かつ効率的な学習を可能にした。
  • モデルの注目メカニズムにより順列不変性が実現され、入力順序の変動に対して頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。