Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning Driven Heuristic Optimization

Qingpeng Cai, Will Hang|arXiv (Cornell University)|Jun 16, 2019
Scheduling and Optimization AlgorithmsEngineering参考文献 17被引用 19
一句话总结

该论文提出RLHO框架,利用强化学习(PPO)生成启发式优化算法(如模拟退火SA)的高质量初始解,在组合优化问题上显著提升性能。通过使用SA的最终解质量作为奖励信号来训练RL智能体,RLHO使智能体能够学习到使SA更有效的初始化策略,在多种装箱问题规模下,其性能优于纯强化学习和随机初始化方法。

ABSTRACT

Heuristic algorithms such as simulated annealing, Concorde, and METIS are effective and widely used approaches to find solutions to combinatorial optimization problems. However, they are limited by the high sample complexity required to reach a reasonable solution from a cold-start. In this paper, we introduce a novel framework to generate better initial solutions for heuristic algorithms using reinforcement learning (RL), named RLHO. We augment the ability of heuristic algorithms to greedily improve upon an existing initial solution generated by RL, and demonstrate novel results where RL is able to leverage the performance of heuristics as a learning signal to generate better initialization. We apply this framework to Proximal Policy Optimization (PPO) and Simulated Annealing (SA). We conduct a series of experiments on the well-known NP-complete bin packing problem, and show that the RLHO method outperforms our baselines. We show that on the bin packing problem, RL can learn to help heuristics perform even better, allowing us to combine the best parts of both approaches.

研究动机与目标

  • 解决诸如模拟退火等启发式算法因从随机初始解开始而带来的高样本复杂度问题。
  • 通过利用强化学习生成更优的初始解,提升启发式优化的性能。
  • 通过将最终解质量作为奖励信号,使RL能够从启发式算法的表现中学习。
  • 证明将RL与启发式方法结合,可在NP完全问题(如装箱问题)上优于单独使用任一方法。

提出的方法

  • RLHO框架在PPO智能体生成初始解与模拟退火(SA)优化之间交替进行。
  • RL智能体使用SA的最终解质量作为密集且信息丰富的奖励信号进行训练,从而指导策略改进。
  • RL智能体观察问题状态,并通过将物品分配至箱子来采取动作,生成SA的初始解。
  • SA组件从RL生成的初始解出发,通过扰动和基于温度调度的接受准则,执行贪婪的随机局部搜索以改进解。
  • 训练循环在RL轨迹与SA优化之间交替进行,使RL智能体能够借助启发式算法的爬山行为探索更优状态。
  • 该框架在不同规模的装箱问题上进行评估,采用PPO进行强化学习,SA作为启发式优化方法。

实验结果

研究问题

  • RQ1强化学习能否学会为模拟退火等启发式优化算法生成更优的初始解?
  • RQ2将启发式算法的最终解质量作为奖励信号,是否能提升RL智能体在组合优化中的性能?
  • RQ3RL与启发式方法的结合是否能在NP完全问题上优于纯RL和纯启发式方法?
  • RQ4即使启发式算法的运行时间远超训练阶段,RL智能体学习到的初始化策略是否仍保持有效性?

主要发现

  • 在1000个物品的装箱问题中,当SA运行50,000步时,RLHO将平均使用箱数从随机初始化的734减少至711。
  • 在SA运行5000步时,RLHO在n=1000的平均箱数为714,相比随机初始化的734,实现了稳定的2.7%改进。
  • 当SA被允许运行至收敛(数百万步),在仅用5000步SA训练的RLHO生成的初始化仍优于随机初始化。
  • 在交替优化中,经过2000次训练迭代后,RLHO在1000个物品问题上相比纯PPO实现了2.1%的性能提升,表明其探索能力更强。
  • 尽管RL本身未能收敛到最优解,但RL智能体学习到了能更有效适应SA爬山过程的初始解。
  • 随着问题规模增大,RLHO与随机初始化之间的性能差距持续扩大,表明RLHO在更大、更复杂的实例上具有更好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。