[論文レビュー] Learning to Solve Multiple-TSP with Time Window and Rejections via Deep Reinforcement Learning
本稿では、時間枠と拒否を伴う複数車両TSP(mTSPTWR)という挑戦的な問題を解くために、新規のマネージャ・ワーカー型深層強化学習フレームワークを提案する。グラフ同型性ネットワーク(GIN)が顧客を車両に割り当て、自己注意型エンコーダ・デコーダが部分ルートを最適化する。本手法は強力なベースラインよりも優れた解の品質と高速な推論を達成し、未観測の大規模インスタンスに対しても良好な一般化性能を示す。
We propose a manager-worker framework based on deep reinforcement learning to tackle a hard yet nontrivial variant of Travelling Salesman Problem (TSP), \ie~multiple-vehicle TSP with time window and rejections (mTSPTWR), where customers who cannot be served before the deadline are subject to rejections. Particularly, in the proposed framework, a manager agent learns to divide mTSPTWR into sub-routing tasks by assigning customers to each vehicle via a Graph Isomorphism Network (GIN) based policy network. A worker agent learns to solve sub-routing tasks by minimizing the cost in terms of both tour length and rejection rate for each vehicle, the maximum of which is then fed back to the manager agent to learn better assignments. Experimental results demonstrate that the proposed framework outperforms strong baselines in terms of higher solution quality and shorter computation time. More importantly, the trained agents also achieve competitive performance for solving unseen larger instances.
研究の動機と目的
- 複数車両、時間枠、顧客拒否を含む実用的ではあるが複雑なTSPの変種に対処すること。
- ルート長と拒否率を最小化すると同時に、車両間の負荷を効率的にバランスさせる深層強化学習フレームワークを設計すること。
- エンド・トゥ・エンドの学習により、より大規模で未観測の問題インスタンスへの一般化を可能にすること。
- 従来のDRLおよびメタヒューリスティック手法が、時間的制約と複数車両制約を併存して扱う際の限界を克服すること。
- 最悪ケースの部分ルートコストを明示的に最小化することで、車両の利用バランスを向上させ、サービス品質を向上させること。
提案手法
- マネージャーエージェントは、ワーカーエージェントからのフィードバックに基づき、グラフ同型性ネットワーク(GIN)を用いて顧客を車両に割り当てる。
- ワーカーエージェントは、自己注意型エンコーダ・デコーダポリシー・ネットワークを用いて、個々の車両ルートを最適化し、ルート長と拒否率の両方を最小化する。
- フレームワークは、ルート長と拒否率を組み合わせたハイブリッド目的関数を用い、マネージャーの割り当て意思決定を最悪ケースの部分ルートコストが指針とする。
- マネージャーとワーカーエージェントは、ワーカーのパフォーマンスフィードバックがマネージャーのポリシーに影響を与えるように、深層強化学習により共同で訓練される。
- システムは合成されたmTSPTWRインスタンス上でエンド・トゥ・エンドに訓練され、訓練済みインスタンスおよびより大規模な未観測インスタンスで評価される。
- ベースライン(TS、SA、BA)のハイパーパrameterは慎重にチューニングされ、表VIIに報告されており、比較実験ではK-meansが初期クラスタリングに用いられている。
実験結果
リサーチクエスチョン
- RQ1DRLベースのマネージャ・ワーカー枠組みは、時間枠と拒否を伴うmTSPTWR問題を効果的に解くことができるか?
- RQ2本手法は、強力なメタヒューリスティックおよびDRLベースラインと比較して、解の品質と推論時間の両面で優れているか?
- RQ3訓練済みエージェントは、より大規模で未観測のmTSPTWRインスタンスにどの程度一般化できるか?
- RQ4最悪ケースの部分ルートコストを最小化するハイブリッド目的関数は、全体のコスト最小化と比較して、よりバランスの取れた車両利用をもたらすか?
- RQ5GINベースのマネージャーは、全体のシステムコストを低減するように顧客を車両に割り当てる上でどの程度効果的か?
主な発見
- 提案されたフレームワークは、3つの強力なメタヒューリスティックベースライン(TS、SA、BA)および適応化されたDRLベースラインを、両方の解の品質と計算時間において顕著に上回る。
- m=5/10、n=100のインスタンスにおいて、本手法はハイブリッドコストをそれぞれ3.55および2.09に達成し、推論時間は0.16秒である。一方、SAは大規模インスタンスで1800秒以上を要する。
- フレームワークは未観測の大規模インスタンスに対しても良好に一般化し、高い解の品質と高速な推論を維持する。
- アブレーションスタディにより、GINベースのマネージャーと自己注意型ワーカーネットワークの有効性が確認された。
- 最悪ケースの部分ルートコストを最小化するハイブリッド目的関数は、全体コスト最小化と比較して、極端な不均衡が生じにくいよりバランスの取れた車両割り当てを実現する。
- m=5、n=100のインスタンスにおいて、本フレームワークは0.07%の拒否率を達成し、ハイブリッドコストは3.55であった。これはSAの3.60のコストを上回り、著しく高速な実行時間も達成している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。