Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Decoder Attention Model with Embedding Glimpse for Solving Vehicle Routing Problems

Liang Xin, Wen Song|arXiv (Cornell University)|Dec 19, 2020
Vehicle Routing Optimization Methods被引用数 11
ひとこと要約

本稿では、車両ルーティング問題における深層強化学習の性能を向上させるために、埋め込みの断片的観察(Embedding Glimpse)層を備えたマルチデコーダー注意モデル(MDAM)を提案する。複数の非共有デコーダーを用いて多様な方策を学習し、それらの異なるパターンを活用するカスタムビーム探索を実施するとともに、訪問済みノードを順次除去することで注目度の質を向上させる再帰的埋め込み機構を採用することで、MDAMは6つのルーティング問題において最先端の性能を達成し、従来の深層学習手法を著しく上回り、推論速度が速いため、従来の最適化ソルバーよりも高い解の質に近づいた。

ABSTRACT

We present a novel deep reinforcement learning method to learn construction heuristics for vehicle routing problems. In specific, we propose a Multi-Decoder Attention Model (MDAM) to train multiple diverse policies, which effectively increases the chance of finding good solutions compared with existing methods that train only one policy. A customized beam search strategy is designed to fully exploit the diversity of MDAM. In addition, we propose an Embedding Glimpse layer in MDAM based on the recursive nature of construction, which can improve the quality of each policy by providing more informative embeddings. Extensive experiments on six different routing problems show that our method significantly outperforms the state-of-the-art deep learning based models.

研究の動機と目的

  • 既存のルーティング問題向け深層強化学習モデルが単一の方策に依存するため、重複する解の軌道が生じるという、解の多様性の制限を是正すること。
  • 注目度計算における不要なノード情報のノイズを低減することで、個々の構築方策の品質を向上させること。
  • 複数のデコーダーが学習した異なる解のパターンを最大限に活用できるように、ビーム探索戦略を設計すること。
  • 訪問済みノードを注目度計算から順次除去することで、将来の意思決定に向けたより情報量の多い埋め込みを提供する再帰的埋め込み機構(Embedding Glimpse)を開発すること。
  • マルチデコーダーの多様性と動的埋め込みの最適化が、広範なルーティング問題において優れた性能を発揮することを実証すること。

提案手法

  • モデルは、全グラフからのノード埋め込みを生成するトランスフォーマー型エンコーダーを用い、その後に非共有の注目度デコーダーを複数設けることで、異なる構築方策を学習する。
  • 各デコーダーは、ノード選択確率分布の相違を促進するように、カルバック・ライブラー発散損失を用いて学習される。
  • カスタムビーム探索は、各デコーダーごとに別々のビームを維持することで、推論時にそれらの異なる解のパターンを完全に活用できる。
  • Embedding Glimpse層は、エンコーダーの上位注目度層から訪問済みノードを再帰的に除去することで、各ステップでデコーダーが関連のあるノード埋め込みのみを受信することを保証する。
  • モデルは、REINFORCEアルゴリズムを用いて強化学習によりエンドツーエンドで訓練され、解の質に基づいて方策勾配が最適化される。
  • モデルはTSP、CVRP、SPCTSPの6つのルーティング問題で評価され、多様性とEmbedding Glimpseの貢献を分離するアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1非共有デコーダーを用いて複数の多様な構築方策を学習することで、車両ルーティング問題における解の品質が著しく向上するか?
  • RQ2Embedding Glimpse層によって訪問済みノードを注目度計算から動的に除去することで、個々の方策の品質が向上するか?
  • RQ3各デコーダーごとに別々のビームを維持するカスタムビーム探索戦略は、複数の方策の多様性を効果的に活用し、より優れた解を見つけるのに有効か?
  • RQ4方策の多様性と改善された埋め込みの組み合わせは、既存の深層学習ベースラインと比較して、多様なルーティング問題インスタンスにおいて優れた性能を示すか?
  • RQ5MDAMモデルは、確率的報酬を伴うオリエンティング問題のようなより複雑な変種や、より大きな問題サイズに対しても一般化しやすいか?

主な発見

  • MDAMは、TSP、CVRP、SPCTSPを含む6つの異なるルーティング問題において、すべてのインスタンスセットで最先端の深層学習ベースのモデルを著しく上回った。
  • マルチデコーダー構造(MD)は一貫して解の品質を向上させ、グリーディデコーディング時でも顕著な性能向上を示し、ビーム探索を組み合わせるとさらなる向上が得られた。
  • Embedding Glimpse層は、最小限の計算コストで方策の品質を向上させ、不要なノード情報の除去が注目度の効果性を高めることを示した。
  • ビーム探索(B=50)では、複数のデコーダーが最良の解を頻繁に発見し、特定の1つのデコーダーが支配的になることはなく、全デコーダーが解空間に有意義に貢献していることが確認された。
  • MDAMは、Concorde や OR-Tools といった高度に最適化された従来のソルバーよりも高い解の質を達成したが、正確解法や反復改善法と比較して著しく高速な推論時間を実現した。
  • モデルは、CVRP(150および200ノード)のようなより大きなインスタンスに対しても一般化がうまくいき、温度チューニング付きサンプリングを用いた強力な既存モデルの変種をも凌駆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。