Skip to main content
QUICK REVIEW

[论文解读] A Bi-Level Framework for Learning to Solve Combinatorial Optimization on Graphs

Runzhong Wang, Zhigang Hua|arXiv (Cornell University)|Jun 9, 2021
Constraint Satisfaction and Optimization参考文献 64被引用 16
一句话总结

本文提出了一种双层强化学习框架,通过策略网络(上层)优化图结构以提升组合优化问题的解质量,同时在修改后的图上利用快速启发式求解器(下层)。该方法在DAG调度、图编辑距离和哈密顿回路问题上均优于传统启发式方法和单层学习基线,实现了更优的解质量,且推理成本相当。

ABSTRACT

Combinatorial Optimization (CO) has been a long-standing challenging research topic featured by its NP-hard nature. Traditionally such problems are approximately solved with heuristic algorithms which are usually fast but may sacrifice the solution quality. Currently, machine learning for combinatorial optimization (MLCO) has become a trending research topic, but most existing MLCO methods treat CO as a single-level optimization by directly learning the end-to-end solutions, which are hard to scale up and mostly limited by the capacity of ML models given the high complexity of CO. In this paper, we propose a hybrid approach to combine the best of the two worlds, in which a bi-level framework is developed with an upper-level learning method to optimize the graph (e.g. add, delete or modify edges in a graph), fused with a lower-level heuristic algorithm solving on the optimized graph. Such a bi-level approach simplifies the learning on the original hard CO and can effectively mitigate the demand for model capacity. The experiments and results on several popular CO problems like Directed Acyclic Graph scheduling, Graph Edit Distance and Hamiltonian Cycle Problem show its effectiveness over manually designed heuristics and single-level learning methods.

研究动机与目标

  • 解决端到端深度学习在图组合优化中面临的可扩展性和模型容量限制问题。
  • 通过将组合优化重新表述为双层优化问题,降低训练深度模型的复杂度。
  • 将传统启发式求解器与强化学习相结合,以提升解质量与训练稳定性。
  • 开发一种可泛化的无标签方法,避免昂贵的监督信号或在大动作空间上的不稳定强化学习训练。
  • 在包括DAG调度、图编辑距离和哈密顿回路问题在内的多种组合优化问题上展示方法的有效性。

提出的方法

  • 该框架采用双层优化:上层强化学习智能体修改图结构(增删边),下层启发式算法在修改后的图上求解组合优化任务。
  • 图卷积网络(GCN)用于编码输入图,策略网络使用残差网络(ResNet)模块和自注意力机制进行状态表征。
  • 使用近端策略优化(PPO)训练上层智能体,采用稀疏奖励,其稀疏程度低于单层强化学习,因启发式反馈提供了更丰富的信号。
  • 下层启发式算法(如LKH3、最近邻)作为环境的一部分嵌入,实现快速且稳定的训练。
  • 该方法无需真实标签,仅依赖启发式结果和通过PPO进行的奖励塑造。
  • 模型组件均为标准结构:GCN用于图编码,ResNet用于策略和价值网络,注意力机制用于捕捉长距离依赖。

实验结果

研究问题

  • RQ1双层框架是否可通过将部分求解任务交由启发式算法,减轻深度学习模型在组合优化中的负担?
  • RQ2通过强化学习学习图结构修改,是否能获得优于端到端学习或固定启发式方法的解质量?
  • RQ3所提方法是否能在不重新训练的情况下,泛化到不同图大小和组合优化问题类型?
  • RQ4双层设计如何缓解强化学习组合优化方法中常见的稀疏奖励问题?
  • RQ5与单层学习和传统启发式方法相比,该方法在解质量与推理效率之间存在何种权衡?

主要发现

  • 在FHCP基准上,PPO-BiHyb找到了25%的哈密顿回路,优于LKH3-fast(0%)和PPO-Single(0%),尽管使用了更快的下层启发式算法。
  • 在FHCP-500/600上,PPO-BiHyb的TSP目标值为6.7 ± 14.0,显著优于PPO-Single(9.5 ± 45.6)和LKH3-accu(6.3 ± 13.0)。
  • 该方法从250–500规模的训练图泛化到500–600规模的测试实例,表现出强大的零样本泛化能力。
  • 即使推理时间长了10倍,PPO-Single(束宽12)仍表现不如PPO-BiHyb,表明双层设计提升了样本效率。
  • 随机-BiHyb基线(随机图修改)已优于LKH3-fast,表明图修改本身即可提升启发式性能。
  • 该方法在DAG调度和图编辑距离问题上取得了最先进结果,超越了手工设计的启发式方法和单层学习基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。