Skip to main content
QUICK REVIEW

[論文レビュー] Combining Reinforcement Learning and Optimal Transport for the Traveling Salesman Problem

Yong Liang Goh, Wee Sun Lee|arXiv (Cornell University)|Mar 2, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本稿では、巡回セールスマン問題(TSP)の強化学習モデルを提案し、自己回帰的デコーディングに代わり微分可能最適輸送を用いてエッジ確率を直接予測することで、推論速度を向上させ、解の品質を向上させている。エンタロピー正則化された最適輸送を微分可能レイヤーとして統合することで、学習可能なデコーダーを必要とせず割り当て制約を満たす。これにより、学習時間を約50%短縮し、GPUメモリ使用量を10%削減しながら、TSP50では最適性ギャップを3倍改善した。

ABSTRACT

The traveling salesman problem is a fundamental combinatorial optimization problem with strong exact algorithms. However, as problems scale up, these exact algorithms fail to provide a solution in a reasonable time. To resolve this, current works look at utilizing deep learning to construct reasonable solutions. Such efforts have been very successful, but tend to be slow and compute intensive. This paper exemplifies the integration of entropic regularized optimal transport techniques as a layer in a deep reinforcement learning network. We show that we can construct a model capable of learning without supervision and inferences significantly faster than current autoregressive approaches. We also empirically evaluate the benefits of including optimal transport algorithms within deep learning models to enforce assignment constraints during end-to-end training.

研究の動機と目的

  • 自己回帰的ディープラーニングモデルがTSPに適用される際の計算非効率性、特に遅くメモリを食うデコーダーに起因する問題を解決すること。
  • エンドツーエンドの学習中に割り当て制約を強制することで、強化学習ベースのTSPソルバーの解の品質を向上させること。
  • 学習可能なデコーダーモジュールを排除することで、学習と推論の高速化を図ること。
  • 変換可能な最適輸送をトランスフォーマー基盤アーキテクチャに統合した際の影響を評価すること。
  • エッジ確率予測を逐次的デコーディングから分離することで、より高速な探索戦略を可能とし、より大きなTSPインスタンスへのスケーラビリティを実現すること。

提案手法

  • モデルは都市座標を処理し、潜在表現を生成するためのマルチヘッドトランスフォーマーインクリプタを用いる。
  • エッジ確率は、トークン表現間の外積によって生成され、n×nのヒートマップを形成する。
  • エンタロピー正則化された最適輸送(Cuturi, 2013)が、ヒートマップを二重確率行列に変換する微分可能レイヤーとして適用され、割り当て制約が強制される。
  • 得られた確率行列を用いて、グリーディーやビームサーチによる有効なTSPツアーをサンプリングまたはデコードする。
  • モデルは教師なしでポリシー勾配強化学習を用いてエンドツーエンドに学習され、ツアー長を最適化する。
  • 自己回帰的デコーディングを回避し、直接エッジ確率を予測することで、逐次的依存性と計算オーバーヘッドを低減する。

実験結果

リサーチクエスチョン

  • RQ1微分可能最適輸送レイヤーを導入することで、追加の計算コストをほとんど増やさずに、強化学習ベースのTSPソルバーの解の品質を向上させることができるか?
  • RQ2学習可能なデコーダーを微分可能最適輸送レイヤーに置き換えることで、学習と推論が高速化され、解の品質が維持または向上するか?
  • RQ3最適輸送制約の統合が、さまざまな問題サイズにおけるTSP解の最適性ギャップにどのように影響するか?
  • RQ4従来の自己回帰的モデルと比較して、本手法のアーキテクチャはより大きなTSPインスタンス(例:TSP100)に対しても効果的にスケーリングできるか?
  • RQ5エッジ確率を自己回帰的生成ではなく直接予測することで、ビームサーチなどの探索戦略がどの程度高速化され、改善されるか?

主な発見

  • 学習可能なデコーダーを備えた自己回帰的モデルと比較して、学習時間をほぼ50%短縮し、GPUメモリ使用量を少なくとも10%削減した。
  • 微分可能レイヤーとしての最適輸送の導入により、TSP50では最適性ギャップが3倍改善され、ビームサーチを用いた場合のギャップは0.52%にまで低下した。
  • ビームサーチを用いた場合、TSP50で0.52%の最適性ギャップを達成し、推論速度において従来の最先端技術を上回りながらも、競争力のある解の品質を維持した。
  • 最適輸送レイヤーは学習時間およびGPU使用量にほとんど影響を与えず、強固な構造的制約を強制しても5%未満のオーバーヘッドしか追加しなかった。
  • 直接エッジ確率予測が可能になったことで、ビームサーチが高速化され、ビーム幅を拡大し、解空間の探索を改善できるようになった。
  • TSP100における実験では、最適輸送レイヤーの恩恵が一貫して得られ、小規模インスタンスにとどまらず有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。