Skip to main content
QUICK REVIEW

[论文解读] A SUMO Framework for Deep Reinforcement Learning Experiments Solving Electric Vehicle Charging Dispatching Problem

Yaofeng Song, Han Zhao|arXiv (Cornell University)|Sep 7, 2022
Transportation and Mobility Innovations被引用 10
一句话总结

本文提出了一种基于SUMO的仿真框架,用于评估深度强化学习(DRL)算法在电动汽车(EV)充电调度中的表现。该框架将DRL智能体(DQN和Dueling DQN)集成到真实的都市交通环境中,以最小化电动汽车前往充电站的行驶时间,结果表明在高密度EV场景下,Dueling DQN相比DQN将总行驶时间减少了39%。

ABSTRACT

In modern cities, the number of Electric vehicles (EV) is increasing rapidly for their low emission and better dynamic performance, leading to increasing demand for EV charging. However, due to the limited number of EV charging facilities, catering to the huge demand for time-consuming EV charging becomes a critical problem. It is quite a challenge to dispatch EVs in the dynamic traffic environment and coordinate interaction among agents. To better serve further research on various related Deep Reinforcment Learning (DRL) EV dispatching algorithms, an efficient simulation environment is necessary to ensure success. As simulator Simulation Urban Mobility (SUMO) is one of the most widely used open-source simulators, it has great significance in creating an environment that satisfies research requirements on SUMO. We aim to improve the efficiency of EV charging station usage and save time for EV users in further work. As a result, we design an EV navigation system on the basis of the traffic simulator SUMO using Jurong Area, Singapore in this paper. Various state-of-the-art DRL algorithms are deployed on the designed testbed to validate the feasibility of the framework in terms of EV charging dispatching problems. Besides EV dispatching problems, the environment can also serve for other reinforcement learning (RL) traffic control problems

研究动机与目标

  • 为应对由于充电基础设施有限和动态交通状况导致的城市区域电动汽车充电需求日益增长的挑战。
  • 利用SUMO构建一个可扩展、逼真的仿真环境,以支持基于DRL的电动汽车调度算法研究。
  • 评估多种DRL算法(DQN和Dueling DQN)在最小化电动汽车前往充电站行驶时间方面的性能。
  • 为未来在智能交通系统中开展强化学习研究(包括多智能体和交通预测集成)建立可复现的测试平台。
  • 通过优化动态城市交通网络中的导航与调度,提升电动汽车充电效率和用户体验。

提出的方法

  • 在开源交通仿真软件SUMO中构建了自定义的电动汽车导航环境,以新加坡裕廊西地区作为真实的城市交通场景。
  • 实现了四种调度策略:随机选择、贪婪选择、DQN和Dueling DQN,用于引导目标电动汽车前往充电站。
  • 设计了一个强化学习智能体,可实时观测交通状况和充电站状态,其状态表示包括车辆位置、到充电站的距离以及排队长度。
  • 使用Adam优化器对DQN和Dueling DQN智能体进行训练,学习率为0.01,批量大小为32,目标网络更新频率为8000步。
  • 使用大小为10,000的回放缓冲区,并采用ε-greedy探索策略(从1降至0.1),以稳定训练过程并提升探索能力。
  • 每个场景模拟50个回合,每回合持续24小时(一整天),EV数量分别为200、300和400,以评估在交通负荷增加情况下的可扩展性。

实验结果

研究问题

  • RQ1基于SUMO的仿真框架能否有效支持在真实都市交通条件下评估DRL算法在电动汽车充电调度中的表现?
  • RQ2基于DRL的调度策略(DQN和Dueling DQN)与启发式方法(随机选择和贪婪选择)相比,在最小化电动汽车前往充电站的行驶时间方面表现如何?
  • RQ3随着EV密度和交通复杂度的增加,DRL模型的性能是否得到提升?若提升,提升幅度如何?
  • RQ4在动态交通环境中,Dueling DQN架构在导航效率和收敛性方面相较于标准DQN的优越程度如何?
  • RQ5所提出的框架能否扩展以支持多智能体DRL,并与交通预测模型集成,以实现更优的实时决策?

主要发现

  • 基于SUMO的仿真框架成功支持了多种DRL算法在电动汽车充电调度中的部署与评估。
  • 当EV数量增至400辆时,Dueling DQN相比DQN将总行驶时间减少了39%,在高密度交通条件下表现出更优性能。
  • 在400辆EV的场景中,Dueling DQN将仿真行驶时间减少至843秒,优于DQN(1,387秒)、随机调度(1,955秒)和贪婪调度(1,648秒)。
  • DQN和Dueling DQN均显著优于随机和贪婪调度策略,得益于其基于状态的决策能力和对动态交通状况的学习能力。
  • 该框架表现出强鲁棒性和可扩展性,随着EV密度增加,性能提升稳定,验证了其在智能交通系统未来强化学习研究中的适用性。
  • 结果证实,基于DRL的导航策略能够通过综合考虑实时交通状况和充电队列信息,有效最小化电动汽车行驶时间,从而提升用户体验和基础设施利用率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。