Skip to main content
QUICK REVIEW

[論文レビュー] Self-Improvement for Neural Combinatorial Optimization: Sample without Replacement, but Improvement

Jonathan Pirnay, Dominik G. Grimm|arXiv (Cornell University)|Mar 22, 2024
Neural Networks and Applications被引用数 4
ひとこと要約

本稿では、神経組合せ最適化の自己改善フレームワークであるGumbeldore (GD) を提案する。GDは、複数ラウンドにわたり現在の方策からサンプリングされた最良の解を教師付き模倣することでモデルを訓練する。バッチ単位の確率的ビームサーチと報酬に基づく方策更新、およびヌクレオスサンプリングを組み合わせることで、TSP、CVRP、特にJSSPにおいて最先端の性能を達成する。強化学習やエキスパートの解軌道を一切必要としない。

ABSTRACT

Current methods for end-to-end constructive neural combinatorial optimization usually train a policy using behavior cloning from expert solutions or policy gradient methods from reinforcement learning. While behavior cloning is straightforward, it requires expensive expert solutions, and policy gradient methods are often computationally demanding and complex to fine-tune. In this work, we bridge the two and simplify the training process by sampling multiple solutions for random instances using the current model in each epoch and then selecting the best solution as an expert trajectory for supervised imitation learning. To achieve progressively improving solutions with minimal sampling, we introduce a method that combines round-wise Stochastic Beam Search with an update strategy derived from a provable policy improvement. This strategy refines the policy between rounds by utilizing the advantage of the sampled sequences with almost no computational overhead. We evaluate our approach on the Traveling Salesman Problem and the Capacitated Vehicle Routing Problem. The models trained with our method achieve comparable performance and generalization to those trained with expert data. Additionally, we apply our method to the Job Shop Scheduling Problem using a transformer-based architecture and outperform existing state-of-the-art methods by a wide margin.

研究の動機と目的

  • 神経組合せ最適化における方策勾配法の高い計算コストと訓練不安定性を緩和する。
  • 正確なソルバーからの高価なエキスパート解に依存することを減らし、モデルが生成する軌道からの自己教師学習を可能にする。
  • 報酬に基づく更新を用いたラウンド単位のビームサーチにより、重複を回避し多様性を高めることで、解探索におけるサンプル効率を向上させる。
  • 複雑な強化学習のファインチューニングを回避することで、大規模なアーキテクチャ(例:トランスフォーマー)における強力な一般化を実現する。
  • 反復的自己模倣に基づく単純で問題に依存しない訓練ループが、エキスパート監視型および強化学習ベースの手法を同等または上回る性能を達成できることを示す。

提案手法

  • 各訓練エポックにおいて、現在の方策を用いて1インスタンスあたり複数の解をサンプリングする。ビーム幅k=32で、バッチ単位の確率的ビームサーチを4ラウンド実行する。
  • 各インスタンスのサンプル集合から最もパフォーマンスの良い解を選出し、教師学習用の擬似エキスパート軌道とする。
  • 推定された報酬(目的関数値の逸脱)に基づいてシーケンスの確率を調整する、証明可能で方策改善戦略を用いて方策を更新する。
  • ラウンドに応じて上昇するtop-p値を用いた動的ヌクレオスサンプリング戦略を導入し、探索と活用のバランスを取る。
  • ラウンド間で探索ツリーを維持することで、リプレースメント付きのサンプリングを回避し、多様性と収束性を向上させる。
  • ジョブおよびマシン単位のアテンションメカニズムとALiBi位置エンコーディングを備えたトランスフォーマーに基づくアーキテクチャに、本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1エキスパートの解軌道を一切使用せず、モデルが生成する解のみを用いた自己模倣ループは、神経組合せ最適化においてエキスパート監視型学習と同等の性能を達成できるか?
  • RQ2重複や冗長な解を最小限に抑えることで、自己改善型訓練におけるサンプリング効率をどのように最大化できるか?
  • RQ3教師付き模倣に基づく単純で問題に依存しない訓練スキームは、大規模な問題において、複雑な方策勾配法をどれほど上回れるか?
  • RQ4確率的ビームサーチと報酬に基づく方策更新の組み合わせは、最小限の計算コストで解の品質を著しく向上させられるか?
  • RQ5提案手法は、通常では方策勾配法で訓練が困難とされる大規模なトランスフォーマー型アーキテクチャにおいて、強力な一般化を実現できるか?

主な発見

  • Gumbeldoreは、正確なソルバーの解にアクセスできない状況下でも、TSPおよびCVRPにおいてエキスパート監視型学習と同等の性能を達成する。
  • ジョブショップスケジューリング問題(JSSP)において、既存の最先端手法を大きく上回り、強力な一般化性とスケーラビリティを示している。
  • 報酬に基づく更新と動的ヌクレオスサンプリングの導入により、サンプル効率が著しく向上し、大量のサンプルを必要としなくなった。
  • 強化学習を一切使用せず、大規模なトランスフォーマー型モデルをJSSPに適用可能にし、方策勾配法のファインチューニングにおける計算的非現実性を克服した。
  • ビームサーチと段階的方策更新を組み合わせた自己模倣ループは、訓練エポックにわたり一貫的かつ測定可能な改善をもたらした。
  • 本手法は問題に依存せず、TSP、CVRP、JSSPを含む多様な組合せ最適化問題に効果的に適用可能であり、最小限のアーキテクチャやハイパーパramータのチューニングで高い性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。