[论文解读] Very Short Term Time-Series Forecasting of Solar Irradiance Without Exogenous Inputs
本文提出了一种数据驱动、无需外部输入的极短期太阳辐照度预测方法,仅使用历史辐照度数据、时间和位置信息。结果表明,经过超参数优化的k近邻回归(kNNR)——特别是10–20个邻居、季节性滞后、透明度因子以及60天训练数据——显著优于ARIMA模型,将模型搜索空间从250,000多个候选减少至1,000个以下,同时在15分钟间隔下1–3小时预测时长远超ARIMA的预测精度。
This paper compares different forecasting methods and models to predict average values of solar irradiance with a sampling time of 15 min over a prediction horizon of up to 3 h. The methods considered only require historic solar irradiance values, the current time and geographical location, i.e., no exogenous inputs are used. Nearest neighbor regression (NNR) and autoregressive integrated moving average (ARIMA) models are tested using different hyperparameters, e.g., the number of lags, or the size of the training data set, and data from different locations and seasons. The hyperparameters and their effect on the forecast quality are analyzed to identify properties which are likely to lead to good forecasts. Using these properties, a reduced search space is derived to identify good forecasting models much faster.
研究动机与目标
- 利用仅历史辐照度、时间和位置数据,提升极短期太阳辐照度预测的准确性。
- 识别在不同地点和季节下能最大化预测性能的超参数配置。
- 通过推导kNNR和ARIMA模型的最小且高概率的搜索空间,降低模型选择的计算负担。
- 提供可复现、透明的模型选择框架,实现更快速的高精度预测模型部署。
- 在相同条件下比较kNNR与ARIMA模型的性能,排除外部变量的影响。
提出的方法
- 本研究使用来自多个地点和季节的历史15分钟太阳辐照度数据,评估k近邻回归(kNNR)和季节性k近邻回归(SNNR)模型。
- 将这些模型与ARIMA和SARIMA进行对比,重点关注滞后数、邻居数、训练窗口大小和数据预处理方法等超参数。
- 使用透明度(辐照度相对于太阳外辐照度的归一化值)作为输入,以减少数据变异性并提升模型泛化能力。
- 通过在离散范围内系统性地扫描超参数,以测试集上的均方根误差(RMSE)作为性能指标,完成模型选择过程。
- 通过分析每个超参数对预测精度的影响,推导出缩减后的搜索空间,重点聚焦于表现更优的kNNR模型。
- 最终的搜索空间包括1–11个非季节性滞后、1–7个季节性滞后,以及10–20个邻居,采用统一权重和固定的k-邻域定义。
实验结果
研究问题
- RQ1在无外部输入的条件下,kNNR与ARIMA哪种预测方法在太阳辐照度预测中表现更优?
- RQ2邻居数、滞后数和训练窗口大小等超参数如何影响不同地点和季节下的预测精度?
- RQ3哪些数据预处理技术(如使用透明度、包含夜间数据)能提升模型性能?
- RQ4能否推导出一个缩减后的搜索空间,在保持高概率找到高精度模型的同时最小化计算成本?
- RQ5邻域定义选择(固定k个邻居 vs. ε-距离邻域)对预测精度和鲁棒性有何影响?
主要发现
- kNNR和SNNR在找到高精度预测模型的可能性方面显著优于ARIMA和SARIMA。
- 使用透明度而非原始辐照度作为输入,可提升模型在不同地点和季节下的性能与泛化能力。
- 在参考样本中包含夜间数据可增强模型的鲁棒性,尤其对kNNR模型效果显著。
- 60天的训练窗口在数据相关性与模型稳定性之间提供了最佳平衡。
- 季节性模型(SNNR)在1–3小时预测中具有优势,尤其当季节性滞后数增加时;但对于15分钟预测,其影响较小。
- 采用固定邻居数(k)的邻域定义比基于距离的邻域定义更稳定且预测更准确,k值在10至20之间时在性能与稳定性之间实现了最佳平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。