Skip to main content
QUICK REVIEW

[论文解读] Charging control of electric vehicles using contextual bandits considering the electrical distribution grid

Christian Römer, Johannes Hiry|arXiv (Cornell University)|Apr 10, 2019
Electric Vehicles and Infrastructure参考文献 15被引用 6
一句话总结

本文提出了一种基于上下文Bandit的电动汽车充电控制系统,通过动态调整定价和功率水平,防止低压配电台区过载。通过集成SUMO和SIMONA仿真器,该方法相比无控制充电,将峰值变压器负载降低了高达70%,平均负载降低了12%,优于无上下文的强化学习方法(如Q-learning)。

ABSTRACT

With the proliferation of electric vehicles, the electrical distribution grids are more prone to overloads. In this paper, we study an intelligent pricing and power control mechanism based on contextual bandits to provide incentives for distributing charging load and preventing network failure. The presented work combines the microscopic mobility simulator SUMO with electric network simulator SIMONA and thus produces reliable electrical distribution load values. Our experiments are carefully conducted under realistic conditions and reveal that conditional bandit learning outperforms context-free reinforcement learning algorithms and our approach is suitable for the given problem. As reinforcement learning algorithms can be adapted rapidly to include new information we assume these to be suitable as part of a holistic traffic control scenario.

研究动机与目标

  • 为应对因电动汽车(EV)无控制充电而带来的电力配电网络过载风险日益增加的问题。
  • 开发一种智能充电控制机制,通过动态定价和功率调节激励负载均衡。
  • 评估上下文Bandit算法在真实电网仿真环境中的有效性。
  • 在真实的交通与电网条件下,将上下文Bandit学习与无上下文的强化学习(如Q-learning)及启发式策略进行比较。
  • 评估基于学习的控制在未来的综合交通与能源管理系统中的可扩展性与适应性。

提出的方法

  • 系统采用上下文Bandit框架,智能体根据实时电网与车辆状态信息选择动作(定价或功率水平)。
  • 动作空间包括调整电价或充电功率,以影响电动汽车的充电行为。
  • 奖励函数定义为兼顾电网稳定性、充电完成度与能源成本效率的效用函数。
  • 仿真框架结合SUMO用于交通建模与SIMONA用于电力网络仿真,以生成真实的电网负载曲线。
  • 实现LinUCB上下文Bandit算法,采用两种动作变体与多种效用函数,以在不同目标下测试性能。
  • 在10天的模拟运行中评估该方法,测量峰值与平均变压器负载,以及奖励累积情况。

实验结果

研究问题

  • RQ1在真实的电动汽车充电场景下,上下文Bandit学习能否有效降低低压电网中配电变压器的峰值与平均负载?
  • RQ2在电网负载管理中,上下文Bandit的性能与无上下文的强化学习(如Q-learning)及启发式策略相比如何?
  • RQ3不同的效用函数与动作变体对系统在电网稳定性与充电效率之间平衡能力的影响是什么?
  • RQ4该算法在多大程度上能够适应动态电网条件并避免网络过载?
  • RQ5将交通与电力网络仿真(SUMO + SIMONA)相结合,对结果的真实性与可靠性有何影响?

主要发现

  • 表现最佳的变体——LinUCB搭配动作变体B、'收入'效用函数及功率目标,将峰值变压器负载从额定容量的201%降低至70%。
  • 与无控制充电相比,平均变压器负载最高降低了12%,显著缓解了电网压力。
  • 上下文Bandit学习优于无上下文的Q-learning,后者因训练时间不足而表现出有限收敛与较差性能。
  • WorkProportional启发式策略的表现几乎与最佳Bandit变体相当,表明在某些情况下,简单的基于价格的控制也可行。
  • 随机化与无引导的充电策略导致严重过载,证实了智能控制机制的必要性。
  • 结果表明,通过适当的超参数调优,上下文Bandit可快速部署并适应新的电网环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。