Skip to main content
QUICK REVIEW

[论文解读] Multi-Decoder Attention Model with Embedding Glimpse for Solving Vehicle Routing Problems

Liang Xin, Wen Song|arXiv (Cornell University)|Dec 19, 2020
Vehicle Routing Optimization Methods被引用 11
一句话总结

该论文提出了一种多解码器注意力模型(MDAM),并引入嵌入瞥见层(Embedding Glimpse layer),以提升车辆路径问题的深度强化学习性能。通过使用无共享解码器训练多个多样化策略,并利用定制化束搜索以充分挖掘其独特的模式,同时结合一种递归嵌入机制,动态移除已访问节点以提升注意力质量,MDAM 在六个路径问题上均达到最先进性能,显著优于先前的深度学习方法,在解的质量上接近传统求解器,且推理速度更快。

ABSTRACT

We present a novel deep reinforcement learning method to learn construction heuristics for vehicle routing problems. In specific, we propose a Multi-Decoder Attention Model (MDAM) to train multiple diverse policies, which effectively increases the chance of finding good solutions compared with existing methods that train only one policy. A customized beam search strategy is designed to fully exploit the diversity of MDAM. In addition, we propose an Embedding Glimpse layer in MDAM based on the recursive nature of construction, which can improve the quality of each policy by providing more informative embeddings. Extensive experiments on six different routing problems show that our method significantly outperforms the state-of-the-art deep learning based models.

研究动机与目标

  • 为解决现有用于路径问题的深度强化学习模型中解决方案多样性有限的问题,这些模型依赖单一策略,因而产生冗余的解轨迹。
  • 通过在注意力计算过程中减少无关节点信息的干扰,提升单个构建策略的质量。
  • 设计一种束搜索策略,以充分挖掘多个解码器所学习到的差异化解模式,从而提升整体解的质量。
  • 开发一种递归嵌入机制——嵌入瞥见层(Embedding Glimpse),动态从注意力计算中移除已访问节点,为未来决策提供更具信息量的嵌入表示。
  • 证明多解码器多样性与动态嵌入优化相结合,可在广泛路径问题上实现卓越性能。

提出的方法

  • 模型使用基于 Transformer 的编码器,从完整图中生成节点嵌入,随后通过多个无共享注意力解码器学习不同的构建策略。
  • 每个解码器均使用 Kullback-Leibler 散度损失进行训练,以鼓励节点选择概率分布的差异性,从而促进策略多样性。
  • 定制化束搜索在推理过程中为每个解码器维护独立的束,从而在推理阶段充分挖掘其独特的解模式。
  • 嵌入瞥见层递归地从编码器顶层注意力层中移除已访问节点,确保解码器在每一步仅接收相关节点的嵌入信息。
  • 该架构通过强化学习端到端训练,采用 REINFORCE 算法,基于解的质量优化策略梯度。
  • 模型在六个路径问题(TSP、CVRP 和 SPCTSP)上进行评估,并通过消融实验分离分析多解码器结构与嵌入瞥见层的贡献。

实验结果

研究问题

  • RQ1通过无共享解码器训练多个多样化构建策略,是否能显著提升车辆路径问题的解质量?
  • RQ2通过嵌入瞥见层动态从注意力计算中移除已访问节点,是否能提升单个策略的质量?
  • RQ3一种为每个解码器维护独立束的定制化束搜索策略,能否有效利用多策略的多样性,从而找到更优解?
  • RQ4多策略多样性与改进嵌入表示的结合,相较于现有深度学习基线模型,在多样化路径问题实例上表现如何?
  • RQ5MDAM 模型在更大规模问题和更复杂变体(如带随机奖励的探险者问题)上是否具备良好的泛化能力?

主要发现

  • MDAM 在六个不同路径问题(包括 TSP、CVRP 和 SPCTSP)的所有实例集上,均显著优于当前最先进深度学习模型。
  • 多解码器结构(MD)持续提升解质量,即使在贪婪解码下也表现出明显性能提升,结合束搜索后进一步增益。
  • 嵌入瞥见层在计算开销极小的情况下提升了策略质量,证明移除无关节点信息可显著增强注意力的有效性。
  • 在束搜索(B=50)下,多个解码器频繁找到最优解,且无单一解码器占据主导地位,证实所有解码器均对解空间有实质性贡献。
  • MDAM 在解质量上可与高度优化的传统求解器(如 Concorde 和 OR-Tools)相媲美,但推理速度远快于精确求解或迭代改进方法。
  • 该模型在更大规模实例(如含 150 和 200 个节点的 CVRP)上泛化良好,优于现有模型的更强变体(如 AM 模型的温度调参采样策略)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。