Skip to main content
QUICK REVIEW

[论文解读] A Deep Reinforcement Learning Algorithm Using Dynamic Attention Model for Vehicle Routing Problems

Bo Peng, Jiahai Wang|arXiv (Cornell University)|Feb 9, 2020
Vehicle Routing Optimization Methods参考文献 30被引用 12
一句话总结

本文提出一种动态注意力模型(AM-D),采用动态编码器-解码器架构,在车辆路径问题(VRP)的每一步构造过程中动态更新节点特征,从而更好地挖掘隐藏的结构信息。该方法优于以往的注意力模型和基线启发式算法,实现了更低的最优性差距,并在不同规模实例上展现出强大的泛化能力。

ABSTRACT

Recent researches show that machine learning has the potential to learn better heuristics than the one designed by human for solving combinatorial optimization problems. The deep neural network is used to characterize the input instance for constructing a feasible solution incrementally. Recently, an attention model is proposed to solve routing problems. In this model, the state of an instance is represented by node features that are fixed over time. However, the fact is, the state of an instance is changed according to the decision that the model made at different construction steps, and the node features should be updated correspondingly. Therefore, this paper presents a dynamic attention model with dynamic encoder-decoder architecture, which enables the model to explore node features dynamically and exploit hidden structure information effectively at different construction steps. This paper focuses on a challenging NP-hard problem, vehicle routing problem. The experiments indicate that our model outperforms the previous methods and also shows a good generalization performance.

研究动机与目标

  • 为解决现有VRP注意力模型中固定节点嵌入的局限性,即节点特征无法随解状态变化而自适应调整。
  • 开发一种动态编码器-解码器架构,使模型能够在每个决策步骤中探索并利用实例中不断演化的结构信息。
  • 端到端地从数据中学习启发式策略,无需人工设计特征或监督信号,直接优化解的质量。
  • 在大规模VRP实例上评估该方法,并分析其在不同问题规模下的泛化性能。
  • 展示将学习到的启发式策略与局部搜索结合,可进一步提升解的质量。

提出的方法

  • 模型采用动态编码器-解码器框架,节点嵌入在每一步均根据当前部分解和图结构进行更新。
  • 通过图注意力机制动态重新嵌入节点特征,捕捉每个构造阶段的上下文相关结构特性。
  • 策略网络通过深度强化学习进行训练,采用REINFORCE算法,基于负路径长度的episode奖励。
  • 模型通过在候选节点上使用可微注意力机制,逐步选择下一个节点来构建解。
  • 推理阶段采用贪婪策略,推理后应用2-OPT局部搜索以进一步提升解的质量。
  • 训练过程为离线进行且计算成本较高,但推理速度极快(平均每个实例仅0.29毫秒),支持实时部署。

实验结果

研究问题

  • RQ1在解构造过程中动态更新节点特征,是否能相比固定嵌入获得更优的VRP启发式策略?
  • RQ2所提出的动态注意力机制是否能提升基准VRP实例上的解质量并减少最优性差距?
  • RQ3该模型在不同规模的未见VRP实例上(如在20个节点上训练但在100个节点上测试)的泛化能力如何?
  • RQ4学习到的启发式策略是否能与局部搜索有效结合,进一步提升解的质量?
  • RQ5训练过程是否可扩展至更大规模的问题实例?与传统启发式算法相比,推理速度如何?

主要发现

  • AM-D显著优于原始静态注意力模型(AM)及其他基线方法,在VRP实例上大幅降低了最优性差距。
  • 在20个节点实例上训练的模型能良好泛化至50和100个节点实例,性能优于部分在更大实例上训练的基线模型。
  • 在100个节点实例上训练的模型在20和50个节点实例上也表现良好,展现出强大的跨尺度泛化能力。
  • 将2-OPT局部搜索与AM-D结合(即AM-D (2OPT))可进一步提升解的质量,但计算时间有所增加。
  • 训练模型的推理速度极快——每个实例仅需0.29毫秒,适合实时应用。
  • 训练阶段计算成本较高(如VRP20需14小时),但为一次性离线过程,支持高效的在线推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。