Skip to main content
QUICK REVIEW

[論文レビュー] Generalization in Deep RL for TSP Problems via Equivariance and Local Search

Wenbin Ouyang, Yisen Wang|arXiv (Cornell University)|Oct 7, 2021
Metaheuristic Optimization Algorithms Research参考文献 26被引用数 6
ひとこと要約

本稿では、同変性、入れ違いの局所探索、カリキュラム学習を組み合わせることで一般化性能を向上させる、巡回セールスマン問題(TSP)向けの深層強化学習フレームワークeMAGICを提案する。50都市までの小規模なインスタンスで学習することで、最大1000都市のランダムおよび現実的TSPインスタンスにおいて最先端の性能を達成し、大規模なTSPLIBインスタンスでは一般化ギャップがわずか3.40%にとどまる。

ABSTRACT

Deep reinforcement learning (RL) has proved to be a competitive heuristic for solving small-sized instances of traveling salesman problems (TSP), but its performance on larger-sized instances is insufficient. Since training on large instances is impractical, we design a novel deep RL approach with a focus on generalizability. Our proposition consisting of a simple deep learning architecture that learns with novel RL training techniques, exploits two main ideas. First, we exploit equivariance to facilitate training. Second, we interleave efficient local search heuristics with the usual RL training to smooth the value landscape. In order to validate the whole approach, we empirically evaluate our proposition on random and realistic TSP problems against relevant state-of-the-art deep RL methods. Moreover, we present an ablation study to understand the contribution of each of its component

研究の動機と目的

  • 計算コストが高いため、大規模TSPインスタンスでは学習が不可能な状況において、深層強化学習ソルバの一般化性能が著しく低い問題に対処する。
  • 訓練時に使用したインスタンスよりも大きなインスタンスで性能を発揮できないという、既存のRLベースTSPソルバの限界を克服する。
  • 小規模なインスタンスで学習可能であり、大規模なインスタンスに対しても効果的に解を求めることが可能なスケーラブルで一般化可能な深層強化学習フレームワークを開発する。
  • アーキテクチャ上の不変性および同変性、それに加えて局所探索とカリキュラム学習の組み合わせが、組合せ最適化における一般化性能に与える影響を調査する。
  • 合成的および実世界のTSPベンチマーク、特に最大1002都市のTSPLIBインスタンスを含む、本手法の有効性を実証する。

提案手法

  • 空間的対称性の下でも一貫した振る舞いを保つために、相対的な都市位置と置換不変処理を用いてモデルに同変性を導入する。
  • 深層強化学習の学習と効率的な局所探索ヒューリスティクス(例:2-opt)を交互に実行することで、報酬のランドスケープを滑らかにし、ポリシー最適化を改善する。
  • 訓練中のポリシーグラデント推定の分散を低減するため、新しいポリシーのロールアウトベースラインを提案する。
  • カリキュラム学習を適用し、小規模(例:20都市)から大規模(例:1000都市)へと段階的に訓練インスタンスのサイズを増加させることで、学習の安定性と一般化性能を向上させる。
  • TSP入力を効果的に処理できるよう、グラフニューラルネットワーク(GNN)、多層パーセプトロン(MLP)、およびアテンションメカニズムを組み合わせたハイブリッドモデルアーキテクチャを設計する。
  • 局所探索で得られた改善された解をターゲットとして用いる、修正されたポリシーグラデント更新を採用することで、ポリシーの収束性と解の品質を向上させる。
Figure 1: Model Architecture of eMAGIC
Figure 1: Model Architecture of eMAGIC

実験結果

リサーチクエスチョン

  • RQ1モデルアーキテクチャにおける同変性が、異なるインスタンスサイズ間でTSP向け深層強化学習ソルバの一般化性能を向上させるか?
  • RQ2強化学習の学習と局所探索を交互に実行することで、最適化のランドスケープがどの程度滑らかになり、ポリシー学習が改善されるか?
  • RQ3カリキュラム学習が、小規模なインスタンスで学習したRLベースTSPソルバの一般化性能をどの程度向上させるか?
  • RQ4標準ベースラインと比較して、提案されたポリシーのロールアウトベースラインは、ポリシーグラデント推定の分散をどの程度低減するか?
  • RQ550都市以下の小規模TSPインスタンスで学習したモデルが、ランダムおよび現実的設定の両方で最大1000都市の大規模TSP問題において、競争力のある性能を達成できるか?

主な発見

  • eMAGICは、大規模な現実的TSPLIBインスタンス(400〜1002都市)において、最適解からの平均ギャップが3.40%にとどまり、他の学習ベース手法を大きく上回る。
  • TSP-1000インスタンスでは平均ギャップが7.05%に達し、TSP-500(6.01%)からのギャップ増加がわずか1.2%にとどまるため、サイズにわたる一般化性能が優れていることが示された。
  • アブレーションスタディの結果、同変性を削除するとTSP-1000で平均ギャップが1.4%増加し、同変性が性能に果たす重要な役割が裏付けられた。
  • 自己評価ベースラインに置き換えると、TSP-1000で平均ギャップが1.1%増加し、ポリシーのロールアウトベースラインが訓練の分散低減に有効であることが確認された。
  • 訓練中に局所探索を削除すると、TSP-1000で平均ギャップが1.6%増加し、局所探索が単なる後処理を超えてポリシー学習を強化していることが示された。
  • eMAGICは実世界のTSPインスタンスに対しても効果的に一般化でき、小規模TSPLIBインスタンス(50〜199都市)では0.46%のギャップを達成し、この範囲のすべての他の学習ベースソルバを上回った。
Figure 2: Detailed Architecture of GNN
Figure 2: Detailed Architecture of GNN

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。