Skip to main content
QUICK REVIEW

[论文解读] Increasing performance of electric vehicles in ride-hailing services using deep reinforcement learning

Jacob F. Pettit, Ruben Glatt|arXiv (Cornell University)|Dec 7, 2019
Transportation and Mobility Innovations参考文献 13被引用 7
一句话总结

本文提出一种基于信任域策略优化(TRPO)的深度强化学习(DRL)方法,用于优化网约车电动车辆(EV)的驾驶与充电策略,降低能源成本与排放。DRL智能体通过学习在电价低、交通拥堵少的非高峰时段充电,超越了启发式策略,实现了更高的收入与更低的每英里成本。

ABSTRACT

New forms of on-demand transportation such as ride-hailing and connected autonomous vehicles are proliferating, yet are a challenging use case for electric vehicles (EV). This paper explores the feasibility of using deep reinforcement learning (DRL) to optimize a driving and charging policy for a ride-hailing EV agent, with the goal of reducing costs and emissions while increasing transportation service provided. We introduce a data-driven simulation of a ride-hailing EV agent that provides transportation service and charges energy at congested charging infrastructure. We then formulate a test case for the sequential driving and charging decision making problem of the agent and apply DRL to optimize the agent's decision making policy. We evaluate the performance against hand-written policies and show that our agent learns to act competitively without any prior knowledge.

研究动机与目标

  • 为应对网约车电动车辆在续航里程有限、充电时间长以及能源价格与需求波动等运营挑战。
  • 构建一个数据驱动的仿真环境,模拟动态电价、排放、高峰定价及充电站排队等现实因素。
  • 训练DRL智能体在无先验知识的情况下学习最优驾驶与充电策略,提升成本效率与服务表现。
  • 将DRL智能体的性能与人工设计的阈值策略进行对比,评估其在类真实环境中的优越性。
  • 展示利用DRL优化单个电动车辆智能体在网约车服务中的可行性,为可扩展的车队级应用铺平道路。

提出的方法

  • 本研究将电动车辆的决策过程建模为马尔可夫决策过程(MDP),状态观测包括电池电量、一天中的时间、预期充电成本、排放量及排队等待时间。
  • 使用OpenAI Gym构建自定义仿真环境,模拟基于曼哈顿的网约车服务,包含120个空间区域、100kWh电池容量及100kW充电站。
  • 环境基于加州的实时电网数据建模,包括每小时的电价与CO₂排放量,并使用真实的纽约市出租车行程数据生成行程。
  • 智能体的动作空间为离散选择:在每个时间步选择充电或接受载客,奖励函数对电池电量使用不足进行惩罚,并对成功载客进行奖励。
  • 采用信任域策略优化(TRPO)算法训练策略,网络结构为两层神经网络,激活函数采用双曲正切函数。
  • 训练使用0.8的折扣因子与4096的批量大小,每个回合模拟连续一周的服务运行。

实验结果

研究问题

  • RQ1DRL智能体是否能在无先验知识的情况下学习到网约车电动车辆的最优驾驶与充电策略,并超越简单的启发式规则?
  • RQ2DRL智能体是否学会利用时间与空间套利机会,例如在电价低且排队少的时段充电?
  • RQ3与基于固定电池阈值的启发式策略相比,DRL智能体的性能如何?
  • RQ4智能体是否能在保持高服务可用性与收入的同时降低能源成本与排放?
  • RQ5智能体的充电行为模式如何?是否与最优经济与环境条件一致?

主要发现

  • DRL智能体的平均奖励高于所有测试的启发式策略,表明其在成本与收入优化方面表现更优。
  • 智能体主要在深夜中部与中午前后充电——这些时段电价最低且充电站拥堵程度最小。
  • 智能体避免在通勤高峰时段充电,因为此时高峰定价高,且对载客与充电站的需求旺盛,导致经济效率低下。
  • 如图1(b)所示,智能体的每英里成本显著低于启发式策略,表明其经济效率更高。
  • 训练过程表现出稳定的强化学习特性,平均回合奖励在超过2,500个回合后持续上升,且移动平均值波动小、方差稳定。
  • 智能体的行为与经济与环境优化目标一致,避免在高成本与高排放时段充电。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。