Skip to main content
QUICK REVIEW

[論文レビュー] Smart Feasibility Pump: Reinforcement Learning for (Mixed) Integer Programming

Qi Meng, Mengxin Wang|arXiv (Cornell University)|Feb 18, 2021
Reinforcement Learning in Robotics参考文献 27被引用数 5
ひとこと要約

本稿では、混合整数プログラミング(MIP)問題の妥当解を効率的に見つけるために、深層強化学習(DRL)を用いたスマート妥当性ポンプ(SFP)を提案する。古典的妥当性ポンプ(FP)にインspiredされ、SFPは制約行列の構造的パターンを捉える新しい畳み込みニューラルネットワーク(CNN)方策を備えたDRLエージェントを採用しており、各ステップでの射影計算を不要にすることで、特に大規模な問題において従来のFPおよびMLPベースのSFPよりも高速な収束を実現する。

ABSTRACT

In this work, we propose a deep reinforcement learning (DRL) model for finding a feasible solution for (mixed) integer programming (MIP) problems. Finding a feasible solution for MIP problems is critical because many successful heuristics rely on a known initial feasible solution. However, it is in general NP-hard. Inspired by the feasibility pump (FP), a well-known heuristic for searching feasible MIP solutions, we develop a smart feasibility pump (SFP) method using DRL. In addition to multi-layer perception (MLP), we propose a novel convolution neural network (CNN) structure for the policy network to capture the hidden information of the constraint matrix of the MIP problem. Numerical experiments on various problem instances show that SFP significantly outperforms the classic FP in terms of the number of steps required to reach the first feasible solution. Moreover, the CNN structure works without the projection of the current solution as the input, which saves the computational effort at each step of the FP algorithms to find projections. This highlights the representational power of the CNN structure.

研究の動機と目的

  • 一般の混合整数計画問題(MIP)の妥当解を効率的に見つける強化学習ベースの手法を開発すること。MIPはNP困難であり、商業用ソルバでもしばしば困難である。
  • 訓練データに事前に計算された妥当解に依存しないようにすることで、教師あり学習の限界を克服すること。
  • 古典的妥当性ポンプ(FP)ヒューリスティクスの限界を克服し、妥当解に到達するまでのステップ数を削減すること。
  • 深層学習、特に畳み込みニューラルネットワーク(CNN)が、全結合(MLP)ネットワークよりもMIPの制約行列における構造的情報をより効果的に捉えられるかを検証すること。
  • 各ステップでの射影計算を必要としないDRLエージェントを設計し、計算効率を向上させること。

提案手法

  • SFPフレームワークは、連続緩和問題を解き、整数解に丸めるのを繰り返す古典的妥当性ポンプ(FP)ヒューリスティクスに基づいている。
  • 深層強化学習エージェントは、MIPの制約行列と現在の解から得られる状態表現を用いて、各ステップで丸める変数を選択する方策を学習する。
  • 2つの方策ネットワークアーキテクチャが評価された:多層パーセプトロン(MLP)と、制約行列を2次元入力として処理し構造的パターンを抽出する新しい畳み込みニューラルネットワーク(CNN)。
  • CNNベースの方策は、各時刻における現在の解の射影を計算する必要がなく、計算オーバーヘッドを低減する。
  • DRLエージェントは、最大ステップ数以内に妥当解に到達したかどうかに基づくスパarsely denseな報酬を用いて強化学習で訓練される。
  • 状態空間には制約行列、目的関数係数、および現在の連続緩和解が含まれ、行動は丸める変数を選択することに対応する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習エージェントは、MIPの妥当解を求める面で、古典的妥当性ポンプを上回ることができるか?
  • RQ2畳み込みニューラルネットワーク(CNN)方策は、MIPの丸め戦略を学習する面で、多層パーセプトロン(MLP)方策を上回ることができるか?
  • RQ3CNNアーキテクチャは、制約行列に隠れた構造的情報を捉えることで、計算コストの高い射影ステップへの依存を減らすことができるか?
  • RQ4SFPエージェントは、問題固有の微調整を必要とせず、異なるMIP問題のサイズや構造に一般化できるか?
  • RQ5目的関数の情報を組み込むことで、SFPフレームワークを、より優れた目的関数品質の妥当解を見つけるために拡張できるか?

主な発見

  • SFP-CNNは、古典的妥当性ポンプ(FP)と比較して、妥当解に到達するまでの平均ステップ数を顕著に削減し、n=9、m=18のIPインスタンスでは平均11.1ステップ(FPは90.0)を達成した。
  • SFP-CNNは、すべての問題サイズにおいてSFP-MLPおよび古典的FPを上回り、最大のIPインスタンスでは90百分位数が29.5ステップ(FPは100.0)であった。
  • CNNベースの方策は、特に大規模な問題においてMLPベースの方策を上回り、SFP-CNNはより速く収束し、平均ステップ数も低くなった。
  • SFP-CNNは、各ステップでの現在の解の射影を計算しない状態でも、FPおよびSFP-MLPがそれを必要とするのとは異なり、優れた性能を維持した。
  • アブレーションスタディの結果、射影情報を削除するとSFP-MLPの性能は著しく低下するが、SFP-CNNは射影なしでもSFP-MLPに射影ありを上回った。
  • CNN構造は、制約行列内の構造的パターンを効果的に捉えており、MIP問題における優れた表現力を持つことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。