Skip to main content
QUICK REVIEW

[论文解读] A Reinforcement Learning Approach for Electric Vehicle Routing Problem with Vehicle-to-Grid Supply

Ajay Narayanan, Prasant Misra|arXiv (Cornell University)|Apr 12, 2022
Electric Vehicles and Infrastructure被引用 9
一句话总结

本文提出 Quik,一种基于强化学习(RL)的框架,用于求解带时间窗和车网互动(V2G)的带容量限制电动车辆路径问题(CEVRPTW-D),在优化配送路线的同时,可在高峰需求期间向电网放电。Quik 的计算速度比混合整数规划(MILP)和遗传算法基线快 24 倍,且解的质量在最优解的 20% 以内,展示了大规模电动车车队在可扩展、实时路径规划方面的潜力。

ABSTRACT

The use of electric vehicles (EV) in the last mile is appealing from both sustainability and operational cost perspectives. In addition to the inherent cost efficiency of EVs, selling energy back to the grid during peak grid demand, is a potential source of additional revenue to a fleet operator. To achieve this, EVs have to be at specific locations (discharge points) during specific points in time (peak period), even while meeting their core purpose of delivering goods to customers. In this work, we consider the problem of EV routing with constraints on loading capacity; time window; vehicle-to-grid energy supply (CEVRPTW-D); which not only satisfy multiple system objectives, but also scale efficiently to large problem sizes involving hundreds of customers and discharge stations. We present QuikRouteFinder that uses reinforcement learning (RL) for EV routing to overcome these challenges. Using Solomon datasets, results from RL are compared against exact formulations based on mixed-integer linear program (MILP) and genetic algorithm (GA) metaheuristics. On an average, the results show that RL is 24 times faster than MILP and GA, while being close in quality (within 20%) to the optimal.

研究动机与目标

  • 为解决最后一公里电动车辆(EV)配送成本高、复杂度大的问题,通过引入车网互动(V2G)能源供应作为收入来源。
  • 对 CEVRPTW-D 问题进行建模与求解——在容量、时间窗和 V2G 放电约束下优化电动车路径,同时最小化总行程成本。
  • 克服精确方法(MILP)和元启发式方法(GA)在大规模电动车配送与多业务操作场景下的可扩展性限制。
  • 设计一种基于价值的强化学习框架,通过离线训练学习高效的路径规划策略,实现车队运营商的实时决策。

提出的方法

  • 强化学习智能体作为车队聚合器,观察编码了车辆-客户及车辆-放电站配对关系的系统状态。
  • 状态空间包括车辆负载、时间、位置和能量水平;动作空间选择下一个访问目标(客户或放电站)。
  • 设计了定制化的奖励函数,以反映行程成本,包含 V2G 放电期间的能源销售收入,并对时间窗违规行为施加惩罚。
  • 框架采用基于价值的强化学习算法(如深度 Q 网络或类似方法),学习将状态映射到动作的策略,以最大化累积折扣奖励。
  • 模型在 Solomon 基准数据集上进行离线训练,以在不同客户和放电站配置下实现泛化能力。
  • 通过计算时间与解的质量两个关键指标,将性能与 MILP(精确方法)和 GA(元启发式方法)基线进行对比评估。

实验结果

研究问题

  • RQ1强化学习能否有效求解结合货物配送与车网互动能源供应的多目标 CEVRPTW-D 问题,且在容量和时间窗约束下表现良好?
  • RQ2与传统 MILP 和 GA 方法相比,基于强化学习的方法在处理包含数百名客户和放电点的大规模电动车配送中的计算效率如何?
  • RQ3在复杂运行约束下,强化学习解的质量(以成本衡量)与最优 MILP 解相比,其保持程度如何?
  • RQ4该强化学习框架能否在需求和电价动态变化的环境中实现真实场景的实时部署?

主要发现

  • 在涉及数百名客户和放电站的大规模实例上,Quik 的平均计算速度比 MILP 和遗传算法基线快 24 倍。
  • 基于强化学习的解在成本上保持在 MILP 最优解的约 20% 以内,表明具有较强的近似最优性。
  • 该框架成功将 V2G 能源放电整合到路径决策中,使电动车在高峰电网需求期间可产生收入,同时不损害配送时间表。
  • 基于价值的强化学习方法能高效扩展至大规模问题实例,克服了精确方法和元启发式方法的计算瓶颈。
  • 奖励工程策略有效平衡了配送成本、时间窗合规性与能源收入,引导智能体学习到成本效益高的策略。
  • 初步结果表明,进一步改进强化学习模型有望缩小与最优解的差距,同时实现对动态需求的实时适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。