[论文解读] Learning to Solve Multiple-TSP with Time Window and Rejections via Deep Reinforcement Learning
本文提出了一种新颖的管理者-工作者深度强化学习框架,用于求解具有时间窗和客户拒绝的多车辆旅行商问题(mTSPTWR),其中图同构网络(GIN)负责将客户分配给车辆,自注意力编码器-解码器则用于优化子路径。该方法在解决方案质量与推理速度方面均优于强基线模型,且在更大未见实例上表现出良好的泛化能力。
We propose a manager-worker framework based on deep reinforcement learning to tackle a hard yet nontrivial variant of Travelling Salesman Problem (TSP), \ie~multiple-vehicle TSP with time window and rejections (mTSPTWR), where customers who cannot be served before the deadline are subject to rejections. Particularly, in the proposed framework, a manager agent learns to divide mTSPTWR into sub-routing tasks by assigning customers to each vehicle via a Graph Isomorphism Network (GIN) based policy network. A worker agent learns to solve sub-routing tasks by minimizing the cost in terms of both tour length and rejection rate for each vehicle, the maximum of which is then fed back to the manager agent to learn better assignments. Experimental results demonstrate that the proposed framework outperforms strong baselines in terms of higher solution quality and shorter computation time. More importantly, the trained agents also achieve competitive performance for solving unseen larger instances.
研究动机与目标
- 为解决涉及多辆车辆、时间窗及客户拒绝的实用但复杂的问题变体。
- 设计一种深度强化学习框架,以高效平衡各车辆负载,同时最小化路径长度与拒绝率。
- 通过端到端训练实现对更大、未见问题实例的良好泛化能力。
- 克服现有DRL与元启发式方法在处理时间与多车辆约束组合时的局限性。
- 通过显式最小化最坏情况子路径成本,促进车辆利用率均衡与服务品质提升。
提出的方法
- 管理者智能体使用图同构网络(GIN)根据工作者智能体的反馈,将客户分配给车辆。
- 工作者智能体采用基于自注意力的编码器-解码器策略网络,以最小化路径长度与拒绝率,优化单个车辆路径。
- 该框架采用混合目标函数,结合路径长度与拒绝率,其中最坏情况子路径成本指导管理者决策。
- 管理者与工作者智能体通过深度强化学习联合训练,工作者的性能反馈用于优化管理者策略。
- 系统在合成的mTSPTWR实例上进行端到端训练,并在训练集与更大未见实例上进行评估。
- 基线模型(TS、SA、BA)的超参数经过仔细调优并在表VII中报告,比较实验中使用K-means进行初始聚类。
实验结果
研究问题
- RQ1基于DRL的管理者-工作者框架能否有效求解具有时间窗与客户拒绝的mTSPTWR问题?
- RQ2与强元启发式及DRL基线相比,所提框架在解决方案质量与推理时间方面表现如何?
- RQ3训练后的智能体在多大程度上能泛化到更大、未见的mTSPTWR实例?
- RQ4最小化最坏情况子路径成本的混合目标函数是否能带来比整体成本最小化更均衡的车辆利用率?
- RQ5基于GIN的管理者在分配客户给车辆方面是否有效降低整体系统成本?
主要发现
- 所提框架在解决方案质量与计算时间方面显著优于三种强元启发式基线(TS、SA、BA)及一个适配的DRL基线。
- 在m=5/10、n=100实例上,该方法分别实现3.55与2.09的混合成本,推理时间仅0.16秒,而SA在更大实例上耗时超过1800秒。
- 该框架在更大未见实例上表现出良好泛化能力,维持高解决方案质量与快速推理速度。
- 消融实验验证了基于GIN的管理者与自注意力工作者网络在提升性能方面的有效性。
- 最小化最坏情况子路径成本的混合目标函数带来更均衡的车辆分配,避免了整体目标最小化中出现的极端不平衡现象。
- 在m=5、n=100实例上,该框架实现0.07%的拒绝率,混合成本为3.55,优于SA的3.60成本与显著更快的运行时间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。