Skip to main content
QUICK REVIEW

[论文解读] Learning Large Neighborhood Search Policy for Integer Programming

Yaoxin Wu, Wen Song|arXiv (Cornell University)|Nov 1, 2021
Reinforcement Learning in Robotics参考文献 45被引用 11
一句话总结

本论文提出一种深度强化学习方法,用于学习整数规划(IP)的大型邻域搜索(LNS)策略,通过因子化动作空间和图神经网络选择变量子集进行再优化。该方法在更短的运行时间内显著优于SCIP和Gurobi,在解的质量方面表现更优,并且在更大规模问题上展现出良好的泛化能力。

ABSTRACT

We propose a deep reinforcement learning (RL) method to learn large neighborhood search (LNS) policy for integer programming (IP). The RL policy is trained as the destroy operator to select a subset of variables at each step, which is reoptimized by an IP solver as the repair operator. However, the combinatorial number of variable subsets prevents direct application of typical RL algorithms. To tackle this challenge, we represent all subsets by factorizing them into binary decisions on each variable. We then design a neural network to learn policies for each variable in parallel, trained by a customized actor-critic algorithm. We evaluate the proposed method on four representative IP problems. Results show that it can find better solutions than SCIP in much less time, and significantly outperform other LNS baselines with the same runtime. Moreover, these advantages notably persist when the policies generalize to larger problems. Further experiments with Gurobi also reveal that our method can outperform this state-of-the-art commercial solver within the same time limit.

研究动机与目标

  • 开发一种基于学习的LNS框架,无需访问求解器内部信息,即可提升整数规划的解质量。
  • 通过将LNS中的变量子集选择分解为每个变量的独立二元决策,解决LNS中指数级庞大的动作空间问题。
  • 训练一个策略网络,利用定制化的演员-评论家算法,选择高质量的变量子集用于再优化。
  • 使训练好的策略能够泛化到更大、未见过的IP实例。
  • 在严格的时间限制下,证明该方法优于商业求解器(如Gurobi)和现有LNS基线方法。

提出的方法

  • 将变量子集的动作空间因子化为独立的二元决策——每个变量被选择为破坏或保留,从而使组合空间变得可处理。
  • 使用参数共享的图神经网络(GNN)并行预测每个变量的破坏概率,实现高效的策略学习。
  • 采用定制化的演员-评论家强化学习算法,基于每次LNS步骤后解质量的改进程度来计算奖励,训练策略网络。
  • 修复算子为现成的IP求解器(SCIP或Gurobi),用于在子IP中重新优化被破坏的变量。
  • 该方法在求解器外部运行,无需访问求解器内部状态或接口。
  • 策略在IP实例分布上进行训练,并在训练规模及更大规模的泛化实例上进行评估。

实验结果

研究问题

  • RQ1深度强化学习策略是否能够学习到在整数规划中选择有效变量子集的策略,即使面对指数级庞大的动作空间?
  • RQ2在运行时间受限的情况下,所提方法是否在解质量上优于SCIP和Gurobi等最先进的求解器?
  • RQ3训练好的LNS策略是否能无需微调即泛化到更大、未见过的IP实例?
  • RQ4与固定大小的破坏策略相比,无固定基数的自适应变量子集选择在LNS中表现如何?
  • RQ5当作为外部改进启发式方法使用时,该方法是否能提升Gurobi等商业求解器的性能?

主要发现

  • 在四个基准IP问题上,该方法仅用SCIP约1/5的运行时间,即实现了更优的解质量。
  • 在相同运行时间限制下,该方法显著优于所有LNS基线方法,所有测试问题的最优性间隙均更低。
  • 该策略能有效泛化到更大规模实例(如SC2、CA2、MC2),在性能上持续优于基线方法和求解器。
  • 当使用Gurobi作为修复求解器时,该方法在所有测试问题上均优于Gurobi自身,并在35个MIPLIB实例中的24个上超越了Gurobi和SCIP,时间限制为1000秒。
  • 在其中一个开放的MIPLIB实例上,该方法发现了优于此前已知最优解的新解。
  • 在MC2实例上,使用Gurobi作为修复求解器时,该方法实现了0.11%的间隙,而Gurobi单独运行时为5.81%,表明其在大规模问题上具有强大性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。