[論文レビュー] H-TSP: Hierarchically Solving the Large-Scale Travelling Salesman Problem
H-TSPは、上位レベルの方策によって小さな都市のサブセットを選択し、その後下位レベルの方策でそのサブセットのTSPを解くことで、大規模なTSPを階層的深層強化学習フレームワークで効率的に解く。10,000ノードのインスタンスにおいて4秒未満で準最先端の解品質を達成し、SOTAの探索ベース手法と比較して推論時間を最大100倍短縮する。
We propose an end-to-end learning framework based on hierarchical reinforcement learning, called H-TSP, for addressing the large-scale Travelling Salesman Problem (TSP). The proposed H-TSP constructs a solution of a TSP instance starting from the scratch relying on two components: the upper-level policy chooses a small subset of nodes (up to 200 in our experiment) from all nodes that are to be traversed, while the lower-level policy takes the chosen nodes as input and outputs a tour connecting them to the existing partial route (initially only containing the depot). After jointly training the upper-level and lower-level policies, our approach can directly generate solutions for the given TSP instances without relying on any time-consuming search procedures. To demonstrate effectiveness of the proposed approach, we have conducted extensive experiments on randomly generated TSP instances with different numbers of nodes. We show that H-TSP can achieve comparable results (gap 3.42% vs. 7.32%) as SOTA search-based approaches, and more importantly, we reduce the time consumption up to two orders of magnitude (3.32s vs. 395.85s). To the best of our knowledge, H-TSP is the first end-to-end deep reinforcement learning approach that can scale to TSP instances of up to 10000 nodes. Although there are still gaps to SOTA results with respect to solution quality, we believe that H-TSP will be useful for practical applications, particularly those that are time-sensitive e.g., on-call routing and ride hailing service.
研究の動機と目的
- オンコールルーティングやライドシェアリングなどの時間に敏感な応用において、大規模TSPインスタンスを効率的に解く挑戦に取り組む。
- 大きな行動空間や高い訓練・推論コストのため、スケーラビリティに欠ける既存の学習ベース手法の限界を克服する。
- 反復的探索に依存せずに、10,000ノードまでのTSPインスタンスに一般化可能なエンドツーエンドでスケーラブルな深層強化学習フレームワークを構築する。
- 推論速度と解品質の間で柔軟なトレードオフを可能にするために、推論時に学習済み下位レベル方策をLKH-3のような高品質なソルバに置き換えることを可能にする。
提案手法
- TSPの解構築を2段階の階層的レベルに分解:上位レベル方策が未訪問都市の中から最大200件のサブセットを選択し、次回のサブツアーに含める。
- 下位レベル方策が選択されたサブセットのTSPツアーを構築し、ドアから出発する現在の部分ルートに統合する。
- 解品質と収束速度を最適化するために、両方の方策を深層強化学習を用いて同時に訓練する。
- 各ステップで問題の有効サイズを小さくする分割統治戦略を採用し、10,000ノードインスタンスへのスケーラビリティを実現する。
- 訓練の安定化と性能向上のため、ウォームアップ訓練戦略とk-NNおよび訪問済みフラグメント特徴の共同訓練を採用する。
- 推論時に学習済み下位レベル方策をLKH-3に置き換えることで、解品質を向上させつつも高速な推論速度を維持する。
実験結果
リサーチクエスチョン
- RQ1階層的深層強化学習フレームワークは、10,000ノードまでのTSPインスタンスにスケーリング可能であり、競争力のある解品質を維持できるか?
- RQ2解品質と推論時間の観点から、階層的アプローチは最先端の探索ベースおよび学習ベースTSPソルバーよりも優れているか?
- RQ3上位レベル方策と下位レベル方策の相対的寄与度は何か? それぞれを独立して改善または置き換え可能か?
- RQ4ウォームアップと共同訓練を特徴とする本手法の訓練戦略は、モデルの安定性と性能をどの程度向上させるか?
- RQ5学習済み下位レベル方策をLKH-3のような高品質なヒューリスティックソルバに置き換えることで、実用的展開が可能になるか? 速度を損なわずに行えるか?
主な発見
- H-TSPは10,000ノードTSPインスタンスで最適解との差が3.42%に抑えられ、SOTAのAtt-GCN+MCTS手法(3.22%差)と同等の解品質を達成した一方で、推論時間を395.85秒からわずか3.32秒に短縮した。
- 本フレームワークは未観測のTSPインスタンスに対しても良好に一般化され、50,000ノードインスタンスでも7.10%の差を維持し、1,000〜50,000ノードの範囲で性能が安定している。
- アブレーションスタディの結果、下位レベル方策が上位レベル方策よりも解品質に大きな影響を与えていることが判明。特にウォームアップ段階が訓練の中心的役割を果たしている。
- 学習済み下位レベル方策をLKH-3に置き換えることで、解品質が向上(例:10,000ノードインスタンスで差が7.32%から5.57%に低下)し、推論時間も27.94秒に保たれた(Att-GCN+MCTSの395.85秒と比較)。
- ウォームアップ訓練が欠落すると最適解との差が20.29ポイント上昇(6.76%から27.05%に)し、訓練の安定性においてその重要性が明確になった。
- k-NNと訪問済みフラグメント特徴の併用により、それぞれ0.93ポイントおよび0.66ポイントの性能向上が得られ、表現学習における価値が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。