Skip to main content
QUICK REVIEW

[論文レビュー] Learning a Large Neighborhood Search Algorithm for Mixed Integer Programs

Nicolas Sonnerat, Pengming Wang|arXiv (Cornell University)|Jul 21, 2021
Machine Learning and Algorithms被引用数 13
ひとこと要約

本稿では、混合整数プログラミング(MIP)のための学習ベースの大型ネighborhood探索(LNS)フレームワークを提案する。初期解生成にはニューラルダイビングモデルを、反復的改善にはニューラルネighborhood選択(NNS)ポリシーを組み合わせる。NNSポリシーは、最適なエキスパートのネ ActiveForm に模倣するように強化学習で学習され、大規模な実世界のMIPインスタンスにおいて、高時間制限下でベースラインと比較して平均プライマルギャップが最大37.8倍改善された。

ABSTRACT

Large Neighborhood Search (LNS) is a combinatorial optimization heuristic that starts with an assignment of values for the variables to be optimized, and iteratively improves it by searching a large neighborhood around the current assignment. In this paper we consider a learning-based LNS approach for mixed integer programs (MIPs). We train a Neural Diving model to represent a probability distribution over assignments, which, together with an off-the-shelf MIP solver, generates an initial assignment. Formulating the subsequent search steps as a Markov Decision Process, we train a Neural Neighborhood Selection policy to select a search neighborhood at each step, which is searched using a MIP solver to find the next assignment. The policy network is trained using imitation learning. We propose a target policy for imitation that, given enough compute resources, is guaranteed to select the neighborhood containing the optimal next assignment amongst all possible choices for the neighborhood of a specified size. Our approach matches or outperforms all the baselines on five real-world MIP datasets with large-scale instances from diverse applications, including two production applications at Google. It achieves $2\ imes$ to $37.8\ imes$ better average primal gap than the best baseline on three of the datasets at large running times.

研究の動機と目的

  • 一回のヒューリスティック手法(例:ニューラルダイビング)では、実行時間が延びても改善が得られないという限界を解消すること。
  • 初期割り当てを超えて反復的にMIP解を改善できるスケーラブルで学習可能なLNSフレームワークの構築。
  • 最適なエキスパートポリシーを模倣するネighborhood選択ポリシーの学習により、高品質な解への高速収束を実現すること。
  • 多様で大規模な実世界のMIPデータセット(大手テクノロジー企業の生産インスタンスを含む)における本手法の有効性を実証すること。

提案手法

  • MIP構造に条件付けられた生成モデルを用いて、ニューラルダイビングモデルがMIP変数の初期可能な割り当てを生成する。
  • 各LNS反復において、現在の割り当てに基づき、ニューラルネighborhood選択(NNS)ポリシーが整数変数の部分集合を選択して未割当化する。
  • 選択された変数が定義する部分MIPは、市販のMIPソルバー(例:SCIP)で解かれて、次の改善された割り当てが得られる。
  • NNSポリシーは、与えられたハミングボール内での最適な次回割り当てを含むネighborhoodを特定するエキスパートポリシーをターゲットとして、模倣学習で学習される。
  • エキスパートポリシーは計算的に高価だが、オフラインでのデータ生成には実行可能であり、最適なネighborhood選択の模倣が可能である。
  • 初期割り当てとネighborhood選択の両方が高次元意思決定上の結合分布としてモデル化されているため、本手法はスケーラブルであり、効率的な推論が可能である。

実験結果

リサーチクエスチョン

  • RQ1学習されたネighborhood選択ポリシーは、大規模MIPにおいて、一回の初期ヒューリスティック手法(例:ニューラルダイビング)を上回る解品質を著しく改善できるか?
  • RQ2MIPのLNSにおいて、最適なエキスパートネighborhoodポリシーの模倣学習は、ヒューリスティック的またはランダムなネighborhood選択と比較して、どのように優れているか?
  • RQ3提案されたLNSフレームワークは、多様な実世界のMIPデータセットにおいて、プライマルギャップの低減という観点で、既存のベースラインをどの程度上回るか?
  • RQ4NNSポリシーの反復的適用により、非反復的ヒューリスティックと比較して、延長された実行時間の利用がどのように向上するか?

主な発見

  • 提案されたND + NNS手法は、大手テクノロジー企業の2つの生産応用を含む5つの多様な実世界MIPデータセットにおいて、すべてのベースラインと同等またはそれを上回る性能を達成した。
  • 3つのデータセットでは、大規模な実行時間下で、最良のベースラインと比較して平均プライマルギャップが2倍から37.8倍改善された。
  • 性能向上の要因は、NNSポリシーの反復的使用に起因し、一回の初期ヒューリスティックであるニューラルダイビングと比較して、より効果的に時間予算を活用できることに起因する。
  • 本手法は、大規模MIPインスタンスにおいてスケーラビリティと有効性を示した。これは、従来の学習ベースのLNS手法が固定されたネighborhood選択や遅い推論によって制限されていた点を改善した。
  • 模倣学習アプローチにより、最適なエキスパートネighborhoodポリシーがうまく近似され、テスト時の高速かつ効果的なネighborhood選択が可能になった。
  • 結果から、エンドツーエンドの訓練やより表現力の高いアーキテクチャ(例:自己回帰モデル)を用いることで、さらなる性能向上が期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。