Skip to main content
QUICK REVIEW

[论文解读] Attention Solves Your TSP, Approximately

Wouter Kool, Herke van Hoof|arXiv (Cornell University)|Mar 22, 2018
Vehicle Routing Optimization Methods被引用 18
一句话总结

该论文提出了一种基于图注意力网络的TSP启发式算法,通过使用带有动态基线的REINFORCE方法进行高效训练,端到端学习近似最优的路径。对于20个节点的实例,其最优性差距降低至0.32%,显著优于先前的有学习启发式方法。

ABSTRACT

The development of efficient (heuristic) algorithms for practical combinatorial optimization problems is costly, so we want to automatically learn them instead. We show the feasibility of this approach on the important Travelling Salesman Problem (TSP). We learn a heuristic algorithm that uses a Neural Network policy to construct a tour. As an alternative to the Pointer Network, our model is based entirely on (graph) attention layers and is invariant to the input order of the nodes. We train the model efficiently using REINFORCE with a simple and robust baseline based on a deterministic (greedy) rollout of the best policy so far. We significantly improve over results from previous works that consider learned heuristics for the TSP, reducing the optimality gap for a single tour construction from 1.51% to 0.32% for instances with 20 nodes, from 4.59% to 1.71% for 50 nodes and from 6.89% to 4.43% for 100 nodes. Additionally, we improve over a recent Reinforcement Learning framework for two variants of the Vehicle Routing Problem (VRP).

研究动机与目标

  • 开发一种端到端可训练的神经启发式算法,用于TSP问题,且对节点顺序不变。
  • 通过减少路径构造中的最优性差距,改进现有的有学习启发式方法。
  • 通过使用稳健且自适应的基线,实现策略网络的高效训练。
  • 将该方法的有效性扩展至车辆路径问题(VRP)的变体。

提出的方法

  • 该模型采用图注意力网络(GAT)架构处理节点嵌入,并对候选节点进行注意力计算,以构建路径。
  • 策略网络通过带有动态基线的REINFORCE进行训练,该基线使用迄今为止构建的最佳确定性路径。
  • 由于其基于注意力的架构,该模型具有排列不变性,确保无论输入节点顺序如何,预测结果保持一致。
  • 路径构建按步骤进行,模型根据未访问节点的注意力分数选择下一个城市。
  • 训练目标是最小化路径长度的负期望值,以促使策略学习高质量的路径。
  • 该方法在TSP及两个VRP变体上进行了评估,证明了其在TSP之外的泛化能力。

实验结果

研究问题

  • RQ1纯注意力机制的神经网络能否学习到一种对输入顺序不变的、具有竞争力的TSP启发式方法?
  • RQ2在REINFORCE训练中使用动态基线是否能带来比静态或随机基线更快的收敛速度和更好的性能?
  • RQ3在不同实例规模下,该有学习启发式方法与先前的有学习及经典启发式方法相比,其最优性差距如何?
  • RQ4该方法能否有效扩展至解决车辆路径问题(VRP)的变体?

主要发现

  • 对于20个节点的TSP实例,该模型将最优性差距降低至0.32%,相比之前工作中的1.51%有显著改善。
  • 对于50个节点的实例,最优性差距从4.59%降低至1.71%。
  • 对于100个节点的实例,最优性差距从6.89%降低至4.43%。
  • 该方法在TSP上优于先前的有学习启发式方法,并且在两个VRP变体上也取得了改进结果。
  • 在REINFORCE训练中使用动态基线可实现稳定且高效的训练过程。
  • 该模型的注意力机制实现了排列不变性,使其对输入顺序具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。