Skip to main content
QUICK REVIEW

[论文解读] Generalization in Deep RL for TSP Problems via Equivariance and Local Search

Wenbin Ouyang, Yisen Wang|arXiv (Cornell University)|Oct 7, 2021
Metaheuristic Optimization Algorithms Research参考文献 26被引用 6
一句话总结

该论文提出eMAGIC,一种用于旅行商问题(TSP)的深度强化学习框架,通过等变性、交错局部搜索和课程学习提升泛化能力。通过在小规模实例(最多50个城市)上进行训练,eMAGIC在更大规模的随机和真实TSP实例(最多1000个城市)上实现了最先进性能,其在大规模TSPLIB实例上的泛化差距仅为3.40%。

ABSTRACT

Deep reinforcement learning (RL) has proved to be a competitive heuristic for solving small-sized instances of traveling salesman problems (TSP), but its performance on larger-sized instances is insufficient. Since training on large instances is impractical, we design a novel deep RL approach with a focus on generalizability. Our proposition consisting of a simple deep learning architecture that learns with novel RL training techniques, exploits two main ideas. First, we exploit equivariance to facilitate training. Second, we interleave efficient local search heuristics with the usual RL training to smooth the value landscape. In order to validate the whole approach, we empirically evaluate our proposition on random and realistic TSP problems against relevant state-of-the-art deep RL methods. Moreover, we present an ablation study to understand the contribution of each of its component

研究动机与目标

  • 解决深度强化学习求解器在大规模TSP实例上泛化能力差的问题,这些实例由于计算成本过高而无法直接训练。
  • 克服现有基于强化学习的TSP求解器在测试时面对比训练时更大规模实例时性能表现不佳的局限性。
  • 开发一种可扩展、可泛化的深度强化学习框架,可在小规模实例上进行训练,并有效求解更大规模实例。
  • 研究架构不变性与等变性,结合局部搜索和课程学习,如何提升组合优化中的泛化能力。
  • 在合成与真实世界TSP基准上(包括最多1002个城市的TSPLIB实例)验证所提方法的有效性。

提出的方法

  • 通过使用相对城市位置和排列不变的处理方式,在模型中引入等变性,确保在空间对称性下行为一致。
  • 将深度强化学习训练与高效的局部搜索启发式算法(如2-opt)交错进行,以平滑奖励景观并改善策略优化。
  • 提出一种新型策略回溯基线,以降低训练过程中策略梯度估计的方差。
  • 通过课程学习,逐步增加训练实例规模,从较小规模(如20个城市)到大规模(如1000个城市),提升训练稳定性和泛化能力。
  • 设计一种混合模型架构,结合图神经网络(GNN)、多层感知机(MLP)和注意力机制,以有效处理TSP输入。
  • 采用改进的策略梯度更新方式,利用局部搜索获得的改进解作为目标,以优化强化学习策略,从而提升收敛速度和解的质量。
Figure 1: Model Architecture of eMAGIC
Figure 1: Model Architecture of eMAGIC

实验结果

研究问题

  • RQ1模型架构中的等变性是否能提升深度强化学习求解器在不同实例规模下对TSP的泛化能力?
  • RQ2将局部搜索与强化学习训练交错进行,在多大程度上能平滑优化景观并改善策略学习?
  • RQ3课程学习在提升基于强化学习的TSP求解器在小规模实例上训练后的泛化能力方面有多有效?
  • RQ4与标准基线相比,所提出的策略回溯基线是否能更有效地降低策略梯度估计的方差?
  • RQ5在小规模TSP实例(≤50个城市)上进行训练的模型,是否能在大规模TSP问题(最多1000个城市)中实现具有竞争力的性能,涵盖随机和真实场景?

主要发现

  • eMAGIC在大规模真实TSPLIB实例(400–1002个城市)上实现了与最优解平均3.40%的差距,显著优于其他基于学习的方法。
  • 在TSP-1000实例上,eMAGIC实现了7.05%的平均差距,仅比TSP-500(6.01%)高出1.2%,表明其在不同规模间具有极强的泛化能力。
  • 消融实验表明,若移除等变性,TSP-1000上的平均差距增加1.4%,证明其在性能中起着关键作用。
  • 若将策略回溯基线替换为自批判基线,TSP-1000上的平均差距增加1.1%,证实其在降低训练方差方面的价值。
  • 若在训练期间移除局部搜索,TSP-1000上的平均差距增加1.6%,表明局部搜索在提升策略学习方面的作用超越了仅作为后处理手段。
  • eMAGIC在真实世界TSP实例上表现出色,在小型TSPLIB实例(50–199个城市)上实现了0.46%的差距,优于该规模范围内所有其他基于学习的求解器。
Figure 2: Detailed Architecture of GNN
Figure 2: Detailed Architecture of GNN

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。