[论文解读] Learning to Solve Vehicle Routing Problems with Time Windows through Joint Attention
该论文提出JAMPR,一种新颖的强化学习模型,通过在多个车辆路径上使用联合注意力机制来求解带时间窗的车辆路径问题(CVRP-TW),实现路径的并行构建与复杂约束下的改进决策。JAMPR在三种CVRP-TW变体上优于最先进的机器学习和元启发式方法,显著提升了求解质量,同时保持了快速的推理速度。
Many real-world vehicle routing problems involve rich sets of constraints with respect to the capacities of the vehicles, time windows for customers etc. While in recent years first machine learning models have been developed to solve basic vehicle routing problems faster than optimization heuristics, complex constraints rarely are taken into consideration. Due to their general procedure to construct solutions sequentially route by route, these methods generalize unfavorably to such problems. In this paper, we develop a policy model that is able to start and extend multiple routes concurrently by using attention on the joint action space of several tours. In that way the model is able to select routes and customers and thus learns to make difficult trade-offs between routes. In comprehensive experiments on three variants of the vehicle routing problem with time windows we show that our model called JAMPR works well for different problem sizes and outperforms the existing state-of-the-art constructive model. For two of the three variants it also creates significantly better solutions than a comparable meta-heuristic solver.
研究动机与目标
- 为解决现有深度学习模型在CVRP-TW中顺序路径构建的局限性,这些模型在复杂约束下表现不佳且泛化能力差。
- 开发一种策略模型,能够同时决定将客户分配给哪个客户以及分配到哪条路径,从而实现路径间的更好权衡。
- 设计一个综合的状态空间与动作空间,整合所有活跃路径、车辆和时间窗的信息。
- 在具有不同约束强度(包括硬性、部分软性和软性时间窗)的多种CVRP-TW变体上评估模型性能。
- 证明在多条路径上使用联合注意力机制可显著提升求解质量,优于顺序模型和元启发式方法。
提出的方法
- JAMPR采用基于Transformer的解码器,并在多条路径上实现联合注意力,使模型在动作选择过程中能同时关注所有路径。
- 模型使用增强的节点、车辆和路径特征嵌入,编码时间窗、容量使用率和路径状态信息。
- 联合动作空间使智能体能够同时选择下一个客户和目标路径,避免对单条路径决策的顺序依赖。
- 策略网络通过在联合动作空间上的指针-注意力机制预测下一步动作,整合路径规划与分配决策。
- 模型通过课程学习进行强化学习训练,从较简单的问题实例开始,逐步增加复杂度。
- 推理阶段采用贪婪解码或带束搜索的采样方法,且并发度 $m_{con}$ 控制并行扩展的路径数量。
实验结果
研究问题
- RQ1能否证明一种采用并行构建多条路径的深度强化学习模型,在具有严格约束的CVRP-TW问题上优于顺序模型?
- RQ2在多条路径上使用联合注意力机制,是否能实现比单条路径构建更优的路径均衡性、时间窗可行性与总成本之间的权衡?
- RQ3该模型在不同CVRP-TW变体上的性能与最先进的机器学习模型及成熟元启发式求解器(如GORT)相比如何?
- RQ4并发度($m_{con}$)对不同规模问题和约束类型下的求解质量与推理速度有何影响?
- RQ5该模型能否泛化到标准CVRP(无时间窗)问题?与现有SOTA模型相比表现如何?
主要发现
- 在所有三种CVRP-TW变体上,JAMPR显著优于适配后的AM +TW模型,TW1(N=50)的平均成本为1716.60,而AM +TW在$t_{10240}$采样下为6878.84。
- 在TW1上,JAMPR的成本比GORT - AU低26.5%,比GORT - GLS低28.5%,且推理速度是后者的8倍。
- 在TW2上,JAMPR的求解质量与GORT相当,但推理速度显著更快(0.25s vs. 8.09s),且在10,240次采样下仍优于AM +TW。
- 在TW3上,JAMPR在所有测试模型中取得最低成本(N=50时为1947.65),优于GORT - GLS(2753.66)和AM +TW(4161.24,含采样)。
- 在标准CVRP(无时间窗)上,JAMPR保持了良好性能,N=50时成本为11.44,略高于AM(10.98)但仍具竞争力。
- 该模型自然生成的车辆数量($k$)少于AM +TW和GORT,表明在如TW1等约束较强场景下具有更优的路径平衡能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。