[论文解读] Short-term forecast of EV charging stations occupancy probability using big data streaming analysis
本文提出了一种基于 Apache Spark 和流式逻辑回归的大数据流架构,用于实时预测电动汽车(EV)充电站的占用概率。通过结合历史充电数据与实时占用流,该模型在突发事件期间相比仅批处理的方法显著提升了预测准确性,其中阈值 0.35 可实现精确率与召回率的平衡(0.63–0.67)。
The widespread diffusion of electric mobility requires a contextual expansion of the charging infrastructure. An extended collection and processing of information regarding charging of electric vehicles may turn each electric vehicle charging station into a valuable source of streaming data. Charging point operators may profit from all these data for optimizing their operation and planning activities. In such a scenario, big data and machine learning techniques would allow valorizing real-time data coming from electric vehicle charging stations. This paper presents an architecture able to deal with data streams from a charging infrastructure, with the final aim to forecast electric charging station availability after a set amount of minutes from present time. Both batch data regarding past charges and real-time data streams are used to train a streaming logistic regression model, to take into account recurrent past situations and unexpected actual events. The streaming model performs better than a model trained only using historical data. The results highlight the importance of constantly updating the predictive model parameters in order to adapt to changing conditions and always provide accurate forecasts.
研究动机与目标
- 解决在动态且不可预测的使用模式下,准确预测电动汽车充电站短期占用率的挑战。
- 开发一种可扩展的大数据流架构,用于处理实时与历史电动汽车充电数据,以提升预测能力。
- 将重复出现的历史趋势与实时异常(如事件、疫情等)整合到单一预测模型中。
- 评估流式机器学习模型在预测充电站可用性方面相对于传统批处理模型的性能表现。
- 优化模型参数与阈值选择,以在实际部署中实现精确率与召回率的平衡。
提出的方法
- 使用 Apache Spark Streaming 和 Apache Kafka 实现大数据流管道,以摄取来自电动汽车充电站的实时占用数据。
- 使用三年的历史充电数据初始化流式逻辑回归模型,并持续通过实时占用流进行更新。
- 通过特征工程将时间模式(如工作日与周末、每小时趋势)以及充电时长分布编码为模型输入。
- 应用基于阈值的分类方法,将占用概率转换为每 15 分钟间隔的二元预测结果(占用或可用)。
- 在包含 525,601 分钟的测试集上,对一系列阈值(0.30–0.50)下的精确率、召回率与 F1 分数进行模型性能评估。
- 通过精确率/召回率曲线与 F1 分数指标,将流式模型的性能与标准批处理训练的逻辑回归模型进行对比。
实验结果
研究问题
- RQ1与批处理模型相比,结合历史与实时数据的流式机器学习模型是否能提升电动汽车充电站的短期占用预测准确性?
- RQ2在突发性充电需求激增等意外事件期间,实时数据流的引入如何影响模型的预测准确性?
- RQ3在预测充电站可用性时,何种占用概率阈值能最优地平衡精确率与召回率?
- RQ4正则化、梯度下降步长与流式窗口大小等模型参数如何影响预测性能?
- RQ5在此类预测场景中,流式逻辑回归相较于其他分类器(如随机森林、梯度提升树)的性能表现如何?
主要发现
- 在 0.30 至 0.50 的所有阈值范围内,流式逻辑回归模型在精确率方面均优于批处理模型,尤其在高占用预测中表现更优。
- 当使用 0.35 的阈值时,模型实现了 0.63–0.67 的平衡 F1 分数,表明精确率与召回率之间具有良好的权衡。
- 在长时间充电事件中,由于实时更新反映了实际使用情况,模型性能得到提升,此时占用概率超过 0.8。
- 占用概率通常低于 0.5,表明标准的 0.5 阈值可能并非最优,较低的阈值(如 0.35)更为合适。
- 模型对实时变化的适应能力显著提升了其预测准确性,尤其在非周期性或破坏性事件(如新冠疫情期间)中表现突出。
- 将历史模式与实时数据流相结合,使模型能够捕捉日常趋势(如工作日高峰)与突发异常,从而比静态模型更具鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。