Skip to main content
QUICK REVIEW

[论文解读] Constrained Combinatorial Optimization with Reinforcement Learning

Rubén Solozabal, Josu Ceberio|arXiv (Cornell University)|Jun 22, 2020
Scheduling and Optimization Algorithms参考文献 34被引用 14
一句话总结

本文提出了一种基于强化学习的约束组合优化框架,通过将问题建模为完全可观测的约束马尔可夫决策过程(CMDPs),利用惩罚信号引导智能体获得可行解。该方法在实时解质量方面优于经典启发式算法、元启发式算法以及 OR-Tools 的 CP-SAT 等约束规划求解器,尤其在大规模或复杂实例上表现更优,此时精确求解器变得不可行。

ABSTRACT

This paper presents a framework to tackle constrained combinatorial optimization problems using deep Reinforcement Learning (RL). To this end, we extend the Neural Combinatorial Optimization (NCO) theory in order to deal with constraints in its formulation. Notably, we propose defining constrained combinatorial problems as fully observable Constrained Markov Decision Processes (CMDP). In that context, the solution is iteratively constructed based on interactions with the environment. The model, in addition to the reward signal, relies on penalty signals generated from constraint dissatisfaction to infer a policy that acts as a heuristic algorithm. Moreover, having access to the complete state representation during the optimization process allows us to rely on memory-less architectures, enhancing the results obtained in previous sequence-to-sequence approaches. Conducted experiments on the constrained Job Shop and Resource Allocation problems prove the superiority of the proposal for computing rapid solutions when compared to classical heuristic, metaheuristic, and Constraint Programming (CP) solvers.

研究动机与目标

  • 将神经组合优化(NCO)扩展至处理一般约束组合问题,包括不可屏蔽约束。
  • 开发一种强化学习方法,通过中间状态表示迭代构建解,从而提升解的质量。
  • 为大规模问题实现快速、近似最优的解,其中精确求解器速度过慢。
  • 在实际运筹学问题(如作业车间调度和虚拟资源分配)上,展示该方法的鲁棒性与可扩展性。

提出的方法

  • 将约束组合问题建模为完全可观测的约束马尔可夫决策过程(CMDPs),基于中间状态实现序列决策。
  • 通过惩罚系数将约束违反情况整合到奖励函数中,使智能体在无需动作空间屏蔽的情况下学习可行策略。
  • 使用指针网络或基于 Transformer 的架构,以动作序列形式生成解,关注状态相关的动作选择。
  • 采用演员-评论家强化学习框架进行策略训练,其中评论家估计价值函数,演员基于累积奖励与惩罚更新策略。
  • 利用完全可观测状态避免使用记忆架构,从而提升泛化能力与性能,优于序列到序列模型。
  • 应用课程学习与采样策略(如 RL_S(40))以稳定训练并提升解的质量。

实验结果

研究问题

  • RQ1强化学习能否有效应用于超越可屏蔽约束的一般约束组合优化问题?
  • RQ2在解的质量与可行性方面,基于惩罚信号的奖励函数设计与动作空间屏蔽相比表现如何?
  • RQ3在实时解生成方面,基于 CMDP 训练的深度强化学习模型能否超越经典启发式算法与 CP 求解器?
  • RQ4随着问题规模与约束复杂度的增加,模型性能如何变化?
  • RQ5该模型在具有不同结构特征的多样化问题实例上,泛化能力如何?

主要发现

  • 在作业车间调度与虚拟资源分配问题上,强化学习模型均优于经典启发式与元启发式算法,实现了更低的最优性差距。
  • 在 JSP10x10 与 JSP15x15 问题上,RL_S(40) 变体的最优性差距低于所有其他启发式与元启发式方法,尽管仍落后于 OR-Tools 的 CP-SAT 求解器。
  • 在 JSP25x25 问题上,OR-Tools 求解器达到相似解质量所需时间显著更长——高出数个数量级,凸显了强化学习模型在实时性能上的优势。
  • 在虚拟资源分配问题中,强化学习模型始终能生成接近最优的分配方案,优于遗传算法,并在大规模实例上与或超越 CP-SAT 的性能。
  • 模型表现出强鲁棒性,不同问题实例间的解质量方差较低,表明其泛化能力稳定。
  • 该方法在不同问题规模间具有良好泛化能力,但随着实例规模增大,性能差距有所扩大,表明可扩展性仍具挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。