Skip to main content
QUICK REVIEW

[論文レビュー] Learning Large Neighborhood Search Policy for Integer Programming

Yaoxin Wu, Wen Song|arXiv (Cornell University)|Nov 1, 2021
Reinforcement Learning in Robotics参考文献 45被引用数 11
ひとこと要約

本論文は、因子化された行動空間とグラフニューラルネットワークを用いて再最適化のための変数部分集合を選択することで、整数プログラミング(IP)のための大規模近傍探索(LNS)方策を学習する深層強化学習手法を提案する。この手法は、短い実行時間でSCIPやGurobiを大きく上回る解の品質を達成し、より大きな問題に対しても良好な一般化性能を示す。

ABSTRACT

We propose a deep reinforcement learning (RL) method to learn large neighborhood search (LNS) policy for integer programming (IP). The RL policy is trained as the destroy operator to select a subset of variables at each step, which is reoptimized by an IP solver as the repair operator. However, the combinatorial number of variable subsets prevents direct application of typical RL algorithms. To tackle this challenge, we represent all subsets by factorizing them into binary decisions on each variable. We then design a neural network to learn policies for each variable in parallel, trained by a customized actor-critic algorithm. We evaluate the proposed method on four representative IP problems. Results show that it can find better solutions than SCIP in much less time, and significantly outperform other LNS baselines with the same runtime. Moreover, these advantages notably persist when the policies generalize to larger problems. Further experiments with Gurobi also reveal that our method can outperform this state-of-the-art commercial solver within the same time limit.

研究の動機と目的

  • 内部ソルバへのアクセスを必要とせずに、整数計画問題の解の品質を向上させる学習ベースのLNSフレームワークを開発すること。
  • LNSにおける指数的になる行動空間に対処するため、変数部分集合選択を各変数ごとの独立した二値意思決定に因子化すること。
  • カスタマイズされたアクター・クリティックアルゴリズムを用いて、再最適化のための高品質な変数部分集合を選択する方策ネットワークを学習すること。
  • 訓練済み方策を、再訓練なしにより大きな未観測IPインスタンスに一般化できることを可能にすること。
  • 厳密な実行時間制限下で、商業ソルバ(Gurobi)および既存のLNSベースラインを上回ることを示すこと。

提案手法

  • 変数部分集合の行動空間を、各変数が破壊されるか保持されるかという独立した二値意思決定に因子化することで、組合せ的空間を扱いやすくする。
  • パラメータ共有を用いたグラフニューラルネットワーク(GNN)を用いて、各変数の破壊確率を並列に予測し、効率的な方策学習を実現する。
  • 各LNSステップ後の解の品質向上に基づく報酬を用いて、カスタマイズされたアクター・クリティック強化学習アルゴリズムで方策ネットワークを学習する。
  • 修復オペレータとして、オフザシェルのIPソルバ(SCIPまたはGurobi)を用い、破壊された変数を部分IPで再最適化する。
  • ソルバの内部インタフェースや状態へのアクセスを一切必要とせず、外部から動作する。
  • 方策はIPインスタンスの分布上で学習され、トレーニングサイズのインスタンスおよびより大きな一般化インスタンスで評価される。

実験結果

リサーチクエスチョン

  • RQ1指数的に大きな行動空間を持つ整数プログラミングにおけるLNSにおいて、深層強化学習方策が効果的な変数部分集合を選択できるか?
  • RQ2実行時間制限下で、提案手法がSCIP や Gurobi といった最先端ソルバを解の品質において上回るか?
  • RQ3再訓練なしに、訓練済みLNS方策がより大きな未観測IPインスタンスに一般化できるか?
  • RQ4固定サイズの破壊とは対照的に、固定サイズでない適応的変数部分集合選択はLNSにおいてどのように異なるか?
  • RQ5Gurobi などの商業ソルバに外部の改善ヒューリスティクスとして適用した場合、その性能が向上するか?

主な発見

  • 4つのベンチマークIP問題において、SCIPの1/5の実行時間で、より優れた解の品質を達成した。
  • 同じ実行時間制限下で、すべてのLNSベースラインを著しく上回り、全テスト問題でより小さい最適性ギャップを示した。
  • SC2、CA2、MC2などのより大きなインスタンスに対しても、効果的に一般化され、ベースラインおよびソルバーよりも性能優位性を維持した。
  • Gurobiを修復ソルバとして使用した場合、全テスト問題でGurobi自体を上回り、35個のMIPLIBインスタンスのうち24個でGurobiとSCIPを上回った(1000秒の時間制限下)。
  • 1つのオープンなMIPLIBインスタンスでは、以前に知られていた最良解よりも優れた解を発見した。
  • Gurobiを用いた場合、MC2で0.11%のギャップを達成したのに対し、Gurobi単体では5.81%であったため、大規模問題において優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。