Skip to main content
QUICK REVIEW

[论文解读] Winner Takes It All: Training Performant RL Populations for Combinatorial Optimization

Nathan Grinsztajn, Daniel Furelos-Blanco|arXiv (Cornell University)|Oct 7, 2022
Vehicle Routing Optimization Methods被引用 6
一句话总结

本文提出 Poppy,一种强化学习方法,通过基于性能的优化目标,使一组互补策略在组合优化中针对不同问题实例进行专业化,从而训练出一个策略群体。通过在训练过程中仅优化每个实例中表现最佳的代理,Poppy 在 TSP、CVRP、0-1 背包问题和作业车间调度问题上实现了最先进(SOTA)的结果,且无需显式的多样性监督。

ABSTRACT

Applying reinforcement learning (RL) to combinatorial optimization problems is attractive as it removes the need for expert knowledge or pre-solved instances. However, it is unrealistic to expect an agent to solve these (often NP-)hard problems in a single shot at inference due to their inherent complexity. Thus, leading approaches often implement additional search strategies, from stochastic sampling and beam search to explicit fine-tuning. In this paper, we argue for the benefits of learning a population of complementary policies, which can be simultaneously rolled out at inference. To this end, we introduce Poppy, a simple training procedure for populations. Instead of relying on a predefined or hand-crafted notion of diversity, Poppy induces an unsupervised specialization targeted solely at maximizing the performance of the population. We show that Poppy produces a set of complementary policies, and obtains state-of-the-art RL results on four popular NP-hard problems: traveling salesman, capacitated vehicle routing, 0-1 knapsack, and job-shop scheduling.

研究动机与目标

  • 解决单代理强化学习在处理 NP-难组合优化问题时,因解空间复杂性带来的局限性。
  • 克服基于构造的强化学习方法中单策略带来的偏差,该偏差会将探索限制在单一启发式路径上。
  • 开发一种可扩展、高效的训练流程,通过不依赖手工设计的行为标记或外部监督,实现有效的策略多样性。
  • 证明基于性能的专门化可产生互补策略,从而在多种 NP-难问题上超越现有基于强化学习的求解器。

提出的方法

  • Poppy 通过共享主干网络训练一组代理,仅对轻量级策略头进行专业化。
  • 采用一种新型策略梯度目标,仅在每个问题实例上更新表现最佳的代理。
  • 该方法利用共享编码器与独立的策略头,实现群体内高效计算。
  • 采用 REINFORCE 方法并引入状态值基线,使用基于 JAX 的 Jumanji 环境动态实现高效模拟。
  • 训练目标通过关注群体内性能差距,隐式促进多样性,无需显式的行为正则化。
  • 该方法应用于四个问题:TSP、CVRP、0-1 背包问题和作业车间调度,所有任务采用一致的架构与超参数。

实验结果

研究问题

  • RQ1通过基于性能的优化目标训练的强化学习代理群体,是否能在组合优化中实现比单代理方法更优的泛化能力与解质量?
  • RQ2通过基于性能的训练实现的隐式专业化,是否能在无显式多样性约束的情况下产生有效且互补的策略?
  • RQ3在多种 NP-难问题上,Poppy 与现有基于强化学习的求解器相比,在解质量与推理效率方面表现如何?
  • RQ4所提出的方法是否可扩展至大规模实例,并在无需额外搜索或微调的情况下保持强性能?

主要发现

  • Poppy 在全部四个基准问题上均达到最先进性能:TSP、CVRP、0-1 背包问题和作业车间调度。
  • 在 TSP1000 上,Poppy 使用 16 条轨迹时,解的差距为 71.7%,显著优于 POMO(120% 差距)和 EAS(114% 差距)。
  • 在时间-性能权衡分析中,Poppy 在所有设置下均持续优于 POMO,且通过增加采样量来匹配 Poppy 性能通常不可行。
  • 对于 0-1 背包问题,从零开始训练群体而无需预训练单个解码器,既有效又高效,耗时仅数分钟。
  • 在 10x10 规模的作业车间调度问题上,Poppy 使用基于 Transformer 的演员-critic 架构与 JAX 加速的动态模拟,成功最小化了完成时间。
  • Poppy 的性能在不同问题规模下均表现稳健,无需手工设计的多样性机制或搜索启发式,完全依赖群体级目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。