Skip to main content
QUICK REVIEW

[論文レビュー] Solve Traveling Salesman Problem by Monte Carlo Tree Search and Deep Neural Network

Zhihao Xing, Shikui Tu|arXiv (Cornell University)|May 14, 2020
Reinforcement Learning in Robotics参考文献 23被引用数 12
ひとこと要約

本論文は、手作業による特徴量設計やラベル付きデータを一切用いずに、巡回セールスマン問題(TSP)を解くための自己学習フレームワークを提案する。TSPを木探索問題に変換し、深層ニューラルネットワークを用いて価値関数推定値でMCTSをガイドすることで、小規模〜中規模のインスタンスでは最先端の性能を達成し、大規模問題でも同等の結果を示した。これは、ランダム、クラスタリング済み、実世界のグラフにわたる強力な一般化性能を示している。

ABSTRACT

We present a self-learning approach that combines deep reinforcement learning and Monte Carlo tree search to solve the traveling salesman problem. The proposed approach has two advantages. First, it adopts deep reinforcement learning to compute the value functions for decision, which removes the need of hand-crafted features and labelled data. Second, it uses Monte Carlo tree search to select the best policy by comparing different value functions, which increases its generalization ability. Experimental results show that the proposed method performs favorably against other methods in small-to-medium problem settings. And it shows comparable performance as state-of-the-art in large problem setting.

研究の動機と目的

  • 手作業による特徴量設計や教師ありデータに依存しない自己学習型でエンドツーエンドのTSPフレームワークの開発。
  • MCTSと深層強化学習を統合することで、組合せ最適化における一般化性能の向上。
  • 従来の深層学習モデルが示すTSPにおけるスケーラビリティの低さや、大規模またはクラスタリング済みグラフでの不安定性の課題の解決。
  • ランダム、クラスタリング済み、実世界のTSPLIBインスタンスを含む多様なグラフタイプにおける手法の評価。

提案手法

  • フレームワークはTSPを木探索問題に変換し、各パスをTSP巡回ルートの候補として扱う。
  • 深層ニューラルネットワークがグラフのトポロジーを64次元のノード特徴量に符号化し、手作業による特徴量設計を置き換える。
  • モンテカルロ木探索(MCTS)はニューラルネットワークの価値関数を用いて探索をガイドし、有望な移動を選択する。
  • 強化学習により、自己生成された経験を用いてネットワークを訓練し、方策最適化には方策勾配法を用いる。
  • MCTSは1回の移動あたり400回のシミュレーションを実行し、UCB1ベースの選択をCp = 0.5で行い、探索と活用のバランスを最適化する。
  • 合成TSPインスタンス(さまざまなサイズ)の学習に、学習率1e-4のAdam最適化手法を用いる。

実験結果

リサーチクエスチョン

  • RQ1MCTSを統合した深層強化学習モデルは、ラベル付きデータが一切ない状況でも、教師あり手法や先行のRLベース手法を上回ることができるか?
  • RQ2本手法は、ランダム、クラスタリング済み、実世界のグラフといった異なるTSPインスタンスタイプに、どの程度一般化できるか?
  • RQ3MCTSと深層ニューラルネットワークの統合は、大規模TSPインスタンスにおける解の質と安定性を向上させるか?
  • RQ4ベンチマークデータセットにおいて、S2V-DQN や AttentionTSP といった最先端モデルと比較して、本手法の性能はどの程度か?

主な発見

  • ランダムTSPインスタンスでは、TSP20で平均最適性ギャップ1.010、TSP50で1.063、TSP100で1.095を達成し、Pointer Networkを上回り、S2V-DQNと同等の性能を示した。
  • クラスタリング済みグラフでは、S2V-DQNに比べてより高い安定性を示し、特にTSP100では1.109の最適性ギャップを達成した(S2V-DQNは1.082)。
  • 最大76ノードの実世界TSPLIBインスタンスでは、平均最適性ギャップが1.003を記録し、S2V-DQNの1.002と同等の性能を示した。
  • 実世界インスタンスではAttentionTSPに大幅に劣るが、AttentionTSPの性能は急激に低下した(例:eil51で1733 vs. 本手法の442)。
  • TSP50で学習したモデルは再訓練なしにTSP100に一般化でき、1.095の最適性ギャップを達成した。これは優れたスケーラビリティを示している。
  • ベイズ最適化により、MCTSにおけるCp = 0.5が最適であると特定され、適切な探索と活用のトレードオフが確保された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。