Skip to main content
QUICK REVIEW

[論文レビュー] Learning Collaborative Policies to Solve NP-hard Routing Problems

Min-Su Kim, Jinkyoo Park|arXiv (Cornell University)|Oct 26, 2021
Vehicle Routing Optimization Methods参考文献 33被引用数 43
ひとこと要約

二つのポリシーからなる階層型DRLフレームワーク(seederとreviser)を導入し、 diverse seeds を生成してそれらを品質のために反復的に改良することでNP困難な経路問題を解決し、TSP、PCTSP、CVRP における単一ポリシーDRLのベースラインより改善する。

ABSTRACT

Recently, deep reinforcement learning (DRL) frameworks have shown potential for solving NP-hard routing problems such as the traveling salesman problem (TSP) without problem-specific expert knowledge. Although DRL can be used to solve complex problems, DRL frameworks still struggle to compete with state-of-the-art heuristics showing a substantial performance gap. This paper proposes a novel hierarchical problem-solving strategy, termed learning collaborative policies (LCP), which can effectively find the near-optimum solution using two iterative DRL policies: the seeder and reviser. The seeder generates as diversified candidate solutions as possible (seeds) while being dedicated to exploring over the full combinatorial action space (i.e., sequence of assignment action). To this end, we train the seeder's policy using a simple yet effective entropy regularization reward to encourage the seeder to find diverse solutions. On the other hand, the reviser modifies each candidate solution generated by the seeder; it partitions the full trajectory into sub-tours and simultaneously revises each sub-tour to minimize its traveling distance. Thus, the reviser is trained to improve the candidate solution's quality, focusing on the reduced solution space (which is beneficial for exploitation). Extensive experiments demonstrate that the proposed two-policies collaboration scheme improves over single-policy DRL framework on various NP-hard routing problems, including TSP, prize collecting TSP (PCTSP), and capacitated vehicle routing problem (CVRP).

研究の動機と目的

  • NP困難な経路問題を問題特有のヒューリスティクスなしに深層RLで解くことを動機づける。
  • 探索と活用のバランスを取る二つの専門ポリシーを備えた階層的フレームワークを提案する。
  • 協調的なポリシーが解の品質と速度をTSP、PCTSP、CVRPで改善することを示す。
  • エントロピー駆動のシードと並列改訂を組み合わせて多様で高度な解を生み出すことを示す。

提案手法

  • 全体の組合せ方空間全体のエントロピーを最大化することで多様な候補ツアーを生成するシーダーを含む2段階のDRLフレームワークを定義する。
  • エントロピー正則化を用いてシードの多様性を奨励し、セグメントポリシーのエントロピーの時間加重和を近似してエントロピーを近似する。
  • ポリシーのパラメータ化の基盤となるニューラルアーキテクチャとしてAM(Attention Model)を活用し、シーダーとリブァイザーを個別に訓練する。
  • 改訂では全ての軌跡を複数のサブツアーに変換し、AMエンコーダから適応させた共有コンテキスト埋め込みで各セグメントを改訂し、更新された全ツアーを統合して最良の候補を選択する。
  • ロールアウト基準を持つREINFORCEに基づく訓練目的を提供し、シーディングにはエントロピーに基づく報酬、改訂には長さの負の報酬を組み込む。
  • TSP、PCTSP、CVRPをN=20、50、100、500の様々なノード数で報告し、Gurobi、OR-Tools、Concorde、LKH3、および他のDRLベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1二ポリシーDRLフレームワーク(seederとreviser)はNP困難な経路問題で単一ポリシーDRL法を上回ることができるか。
  • RQ2エントロピー正則化されたシードが、並列改訂と組み合わせた場合、探索に依存する解の品質を損なうことなく多様性を高められるか。
  • RQ3現実的な予算下で、LCP方式はTSP、PCTSP、CVRPにおいて解の品質と計算時間の面でどのように性能を発揮するか。

主な発見

  • LCPはNが最大100までのTSP、PCTSP、CVRPにおいて、AM、DRL-2optなどの単一ポリシーDRLベースラインより優れていると測定実験で示される。
  • エントロピー正則化されたシードとリブァイザーの組み合わせが最良の性能をもたらし、バニラAMや他の設定と比較した改善をアブレーションで検証する。
  • リブァイザーの並列サブツアー改訂は推論あたりの探索空間を大きくし、総反復回数を減少させることで収束を速める。
  • LCPは時間的トレードオフの点で有利な結果を示し、DRLソルバーや一部の従来ヒューリスティックよりも優れたタイムボリューム領域を獲得する。
  • 本アプローチはアーキテクチャに依存せず、他のAM風モデルやニューラルアーキテクチャにも適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。