[论文解读] Learning What to Defer for Maximum Independent Sets
该论文提出了一种名为学习推迟(Learning What to Defer, LwD)的深度强化学习框架,通过允许智能体在多个步骤中推迟对顶点的决策,从而提升大规模最大独立集(MIS)问题的可扩展性,实现逐元素选择的批量处理。LwD在MIS问题上达到当前最优性能,并在时间约束下优于CPLEX,尤其在整数二次规划失效的若干组合优化问题上表现优异。
Designing efficient algorithms for combinatorial optimization appears ubiquitously in various scientific fields. Recently, deep reinforcement learning (DRL) frameworks have gained considerable attention as a new approach: they can automate the design of a solver while relying less on sophisticated domain knowledge of the target problem. However, the existing DRL solvers determine the solution using a number of stages proportional to the number of elements in the solution, which severely limits their applicability to large-scale graphs. In this paper, we seek to resolve this issue by proposing a novel DRL scheme, coined learning what to defer (LwD), where the agent adaptively shrinks or stretch the number of stages by learning to distribute the element-wise decisions of the solution at each stage. We apply the proposed framework to the maximum independent set (MIS) problem, and demonstrate its significant improvement over the current state-of-the-art DRL scheme. We also show that LwD can outperform the conventional MIS solvers on large-scale graphs having millions of vertices, under a limited time budget.
研究动机与目标
- 解决现有深度强化学习(DRL)求解器在大规模组合优化问题中因每次仅处理一个顶点而导致的可扩展性限制。
- 通过支持自适应的多步决策机制,克服DRL求解器随解规模线性增长的计算瓶颈。
- 设计一种DRL框架,学习在何时决定顶点是否属于独立集,何时推迟决策,其灵感来源于消息传递和局部可分解性。
- 通过引入一种新颖的多样化奖励机制,在训练过程中提升解的多样性,从而在时间受限的评估中增强性能。
- 证明所提出方法在包含数百万个顶点的大规模图上,能够超越传统启发式求解器和现有DRL基线方法。
提出的方法
- 将MIS问题建模为马尔可夫决策过程(MDP),其中智能体作用于未确定状态的顶点,选择将其分配至独立集或推迟决策。
- 引入一种新颖的“推迟”动作,使智能体能够跳过即时决策,从而实现在多个步骤中批量处理决策。
- 设计一种具有耦合策略的多智能体MDP框架,生成两个解并最大化其差异,采用基于ℓ₁的多样性奖励以鼓励解的多样性。
- 在训练过程中引入解的多样化奖励,明确奖励两个智能体在中间顶点状态上的显著差异,从而提升泛化能力和最终解的质量。
- 采用带有课程学习的演员-评论家强化学习框架进行训练,使智能体逐步接触更复杂的图结构。
- 使用图神经网络(GNN)编码顶点特征和局部邻域结构,使智能体能够推理局部可行性与全局结构。
实验结果
研究问题
- RQ1DRL智能体能否学会推迟顶点决策,从而减少求解大规模MIS问题所需的步数?
- RQ2学习推迟决策是否能带来比贪心型、每次仅处理一个顶点的DRL基线方法更快的收敛速度和更优的解质量?
- RQ3一种通过最大化耦合智能体解之间偏差来设计的多样化奖励机制,能否提升泛化能力与时间约束下的性能表现?
- RQ4在CPLEX因整数二次规划复杂性而失效的情况下,LwD框架在大规模图上能多大程度上超越传统求解器CPLEX?
- RQ5LwD框架是否能泛化至MIS以外的其他局部可分解组合优化问题,如最大权独立集(MWIS)、奖赏收集型MIS(PCMIS)、MAXCUT和伊辛模型?
主要发现
- LwD在所有测试图类型(包括Erdős-Rényi、Barabási-Albert、SATLIB和真实世界图)上,显著优于当前最先进的DRL基线方法。
- LwD的性能随着时间预算的增加(即最大步数T提高)而单调提升,证实推迟决策能有效提升解的质量。
- 所提出的多样化奖励机制使耦合智能体最终解之间的ℓ₁偏差显著大于使用熵正则化的基线方法,后者趋于收敛至相似解。
- 在5秒时间限制下,LwD在最大权独立集(MWIS)、奖赏收集型MIS(PCMIS)、MAXCUT和伊辛模型推理问题上均优于CPLEX,尤其在CPLEX因IQP复杂性而失效的大图上表现更优。
- 在ER-[400,500]图上,CPLEX无法为PCMIS、MAXCUT和伊辛问题生成合理解,而LwD始终能生成高质量解。
- 将多样化奖励与熵正则化结合可获得最佳性能,表明在DRL求解器中,探索与解的多样性均对实现高质量泛化至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。