Skip to main content
QUICK REVIEW

[论文解读] Smart Feasibility Pump: Reinforcement Learning for (Mixed) Integer Programming

Qi Meng, Mengxin Wang|arXiv (Cornell University)|Feb 18, 2021
Reinforcement Learning in Robotics参考文献 27被引用 5
一句话总结

本文提出一种基于深度强化学习(DRL)的智能可行性泵(SFP),以高效求解混合整数规划(MIP)问题的可行解。受经典可行性泵启发,SFP采用一种新型卷积神经网络(CNN)策略的DRL智能体,能够捕捉约束矩阵中的结构模式,避免在每一步计算投影,从而在较大规模问题上相比传统FP和基于MLP的SFP实现更快收敛。

ABSTRACT

In this work, we propose a deep reinforcement learning (DRL) model for finding a feasible solution for (mixed) integer programming (MIP) problems. Finding a feasible solution for MIP problems is critical because many successful heuristics rely on a known initial feasible solution. However, it is in general NP-hard. Inspired by the feasibility pump (FP), a well-known heuristic for searching feasible MIP solutions, we develop a smart feasibility pump (SFP) method using DRL. In addition to multi-layer perception (MLP), we propose a novel convolution neural network (CNN) structure for the policy network to capture the hidden information of the constraint matrix of the MIP problem. Numerical experiments on various problem instances show that SFP significantly outperforms the classic FP in terms of the number of steps required to reach the first feasible solution. Moreover, the CNN structure works without the projection of the current solution as the input, which saves the computational effort at each step of the FP algorithms to find projections. This highlights the representational power of the CNN structure.

研究动机与目标

  • 开发一种基于强化学习的方法,高效求解一般混合整数规划(MIP)问题,此类问题为NP难问题,且对商业求解器常具挑战性。
  • 通过避免在训练数据中依赖预计算的可行解,克服监督学习的局限性。
  • 通过减少达到可行解所需步数,改进经典可行性泵(FP)启发式算法。
  • 探究深度学习,特别是卷积神经网络(CNN),是否能比全连接网络(MLP)更好地捕捉MIP约束矩阵中的结构信息。
  • 设计一种DRL智能体,无需在每一步计算投影,从而提升计算效率。

提出的方法

  • SFP框架基于可行性泵(FP)启发式算法,该算法在求解连续松弛问题与整数解舍入之间交替进行。
  • 深度强化学习智能体学习一种策略,以在每一步选择需舍入的变量,其状态表示基于MIP约束矩阵和当前解。
  • 评估了两种策略网络架构:多层感知机(MLP)和一种新型卷积神经网络(CNN),后者将约束矩阵作为二维输入以提取结构模式。
  • 基于CNN的策略避免在每个时间步计算当前解的投影,从而降低计算开销。
  • 通过基于稀疏密集奖励的强化学习进行DRL智能体训练,奖励基于在最大步数内是否成功达到可行解。
  • 状态空间包括约束矩阵、目标系数和当前连续松弛解,动作则对应选择用于舍入的变量。

实验结果

研究问题

  • RQ1深度强化学习智能体能否在求解MIP可行解方面优于经典可行性泵?
  • RQ2卷积神经网络(CNN)策略是否在学习MIP有效舍入策略方面优于多层感知机(MLP)策略?
  • RQ3CNN架构能否捕捉约束矩阵中的隐藏结构信息,从而减少对计算成本高昂的投影步骤的依赖?
  • RQ4SFP智能体是否能在无需问题特定微调的情况下,泛化到不同规模和结构的MIP问题?
  • RQ5SFP框架是否可通过引入目标函数信息,扩展为寻找目标质量更优的可行解?

主要发现

  • SFP-CNN在IP实例(n=9, m=18)上显著减少达到可行解的平均步数,平均仅需11.1步,而FP需90.0步。
  • SFP-CNN在所有问题规模下均优于SFP-MLP和经典FP,最大IP实例的第90百分位步数为29.5步,而FP为100.0步。
  • 基于CNN的策略性能优于基于MLP的策略,尤其在大规模问题上,SFP-CNN收敛更快且平均步数更低。
  • SFP-CNN即使在不使用每步当前解投影信息的情况下,仍保持优异性能,而FP和SFP-MLP则依赖该信息。
  • 消融实验表明,移除投影信息会显著降低SFP-MLP性能,而SFP-CNN在无投影情况下仍优于SFP-MLP使用投影的情况。
  • CNN结构能有效捕捉约束矩阵中的结构模式,展现出对MIP问题更优的表征能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。