Skip to main content
QUICK REVIEW

[论文解读] A Deep Reinforcement Learning Approach for Solving the Traveling Salesman Problem with Drone

Aigerim Bogyrbayeva, Taehyun Yoon|arXiv (Cornell University)|Dec 22, 2021
Vehicle Routing Optimization Methods被引用 7
一句话总结

该论文提出了一种混合深度强化学习模型,结合基于注意力的编码器与LSTM解码器,以解决带有无人机的旅行商问题(TSP-D),实现卡车与无人机的协同路径规划。LSTM解码器通过隐藏状态记忆捕捉车辆间的依赖关系,显著提升了解决方案质量与计算效率,相较于无状态注意力模型表现更优,性能接近运筹学基准方法。

ABSTRACT

Reinforcement learning has recently shown promise in learning quality solutions in many combinatorial optimization problems. In particular, the attention-based encoder-decoder models show high effectiveness on various routing problems, including the Traveling Salesman Problem (TSP). Unfortunately, they perform poorly for the TSP with Drone (TSP-D), requiring routing a heterogeneous fleet of vehicles in coordination -- a truck and a drone. In TSP-D, the two vehicles are moving in tandem and may need to wait at a node for the other vehicle to join. State-less attention-based decoder fails to make such coordination between vehicles. We propose a hybrid model that uses an attention encoder and a Long Short-Term Memory (LSTM) network decoder, in which the decoder's hidden state can represent the sequence of actions made. We empirically demonstrate that such a hybrid model improves upon a purely attention-based model for both solution quality and computational efficiency. Our experiments on the min-max Capacitated Vehicle Routing Problem (mmCVRP) also confirm that the hybrid model is more suitable for the coordinated routing of multiple vehicles than the attention-based model. The proposed model demonstrates comparable results as the operations research baseline methods.

研究动机与目标

  • 为解决最后一英里配送中异构车辆(卡车与无人机)协同路径规划的挑战。
  • 克服无状态注意力模型在处理TSP-D中车辆间依赖关系与等待约束方面的局限性。
  • 开发一种端到端的深度强化学习模型,无需外部算法组件即可学习高质量解。
  • 评估模型在其他协同路径规划问题(如最小-最大容量车辆路径问题,mmCVRP)中的泛化能力。

提出的方法

  • 模型使用基于注意力的编码器,将客户位置与车辆状态嵌入为上下文表征。
  • 基于LSTM的解码器通过隐藏状态编码各车辆已采取动作的序列,实现对历史决策的记忆与协同。
  • 解码器通过结合当前车辆状态、前一节点的嵌入表示以及决策车辆剩余容量的上下文向量,对未访问节点计算注意力权重。
  • 模型通过强化学习进行训练,奖励函数被设计为最小化完成时间(即服务所有客户所需时间)。
  • 通过调整输入表示与奖励函数,将该架构扩展至mmCVRP,以支持多辆车辆与容量约束。
  • 在标准基准数据集上对TSP-D与mmCVRP进行评估,与仅使用注意力的模型及OR-Tools基准方法进行对比。

实验结果

研究问题

  • RQ1深度强化学习模型能否有效协调TSP-D中异构车辆(卡车与无人机)的路径规划,其中车辆可能需相互等待?
  • RQ2基于LSTM的解码器是否在建模车辆间依赖关系与提升TSP-D解决方案质量方面优于无状态注意力解码器?
  • RQ3所提出的混合模型能否泛化至其他协同路径规划问题,如具有多辆车辆与容量约束的mmCVRP?
  • RQ4在解决方案质量与计算效率方面,该模型与成熟的运筹学方法(如OR-Tools)相比表现如何?
  • RQ5该模型在不同规模问题与客户位置分布下是否具备鲁棒性?

主要发现

  • 所提出的混合模型(HM)在TSP-D中显著优于纯注意力模型(AM),实现更低的解成本与更快的推理速度。
  • 在含20、50与100个客户的TSP-D实例中,HM相对于Concorde的平均成本差距分别为1.38%、5.39%与9.93%,同时远快于精确方法。
  • 在三辆车辆的mmCVRP中,HM在N=20时的差距为1.04%,在N=30时为0.00%,性能与OR-Tools相当,且计算时间更低。
  • LSTM解码器通过维持可追踪决策历史的隐藏状态,显著提升了卡车与无人机之间的协同能力,尤其在处理等待约束方面表现更优。
  • 该模型在mmCVRP上表现出良好的泛化能力,表明同一架构与超参数可适用于不同协同路径规划问题。
  • 尽管HM在TSP-D与mmCVRP上表现具有竞争力,但在经典TSP问题上其性能仍逊于AM,表明未来需针对多样化路径规划问题开发更具通用性的架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。