Skip to main content
QUICK REVIEW

[论文解读] Nearest-Neighbor Based Non-Parametric Probabilistic Forecasting with Applications in Photovoltaic Systems

Jorge Ángel González Ordiano, Wolfgang Doneit|arXiv (Cornell University)|Jan 23, 2017
Energy Load and Power Forecasting参考文献 5被引用 7
一句话总结

该论文提出了一种基于k近邻(k-NN)的方法,通过转换训练数据,使传统回归模型能够在不优化不可微的分位数损失函数(pinball loss)的情况下执行分位数回归,从而简化非参数概率预测。该方法在光伏功率预测中实现了准确的概率预测,其中支持向量回归(SVR)在训练时间较长的情况下取得了最准确的区间预测结果。

ABSTRACT

The present contribution offers a simple methodology for the obtainment of data-driven interval forecasting models by combining pairs of quantile regressions. Those regressions are created without the usage of the non-differentiable pinball-loss function, but through a k-nearest-neighbors based training set transformation and traditional regression approaches. By leaving the underlying training algorithms of the data mining techniques unchanged, the presented approach simplifies the creation of quantile regressions with more complex techniques (e.g. artificial neural networks). The quality of the presented methodology is tested on the usecase of photovoltaic power forecasting, for which quantile regressions using polynomial models as well as artificial neural networks and support vector regressions are created. From the resulting evaluation values it can be concluded that acceptable interval forecasting models are created.

研究动机与目标

  • 解决使用不可微损失函数(如分位数损失)训练复杂非参数概率预测模型的挑战。
  • 通过k-NN对训练数据进行转换,简化如人工神经网络(ANN)和支持向量回归(SVR)等高级模型的分位数回归构建。
  • 通过将多个分位数回归结果组合为具有可控覆盖率的预测区间,实现在光伏功率系统中的概率预测。
  • 使用多种回归技术及k-NN配置,在真实光伏功率数据上评估所提方法的性能。
  • 评估在不同名义覆盖率水平下,所得预测区间的可靠性和准确性。

提出的方法

  • 该方法通过为每个目标点选取k个最近邻点,利用其目标值对训练数据进行变换,从而为每个分位数训练标准回归模型。
  • 对于每个分位数 q ∈ [0.01, 0.99],在k-NN子集上训练独立的回归模型,以近似目标变量的条件q-分位数。
  • k-NN变换确保了每个分位数回归的训练数据具有局部代表性,使传统回归算法能够隐式学习分位数行为。
  • 通过组合两个分位数回归的输出(例如 q = 0.1 和 q = 0.9)形成预测区间,从而生成具有给定名义覆盖率的概率预测。
  • 该方法通过k-NN实现的数据重加权,避免了对不可微分位数损失函数的直接优化,同时保留了对ANN、SVR和多项式模型的标准训练算法。
  • 模型评估使用可靠性偏差和分位数损失来评估区间质量,结果在不同最近邻数量和名义覆盖率下进行分析。

实验结果

研究问题

  • RQ1k-最近邻数据变换是否能使标准回归模型在不优化不可微损失函数的情况下执行分位数回归?
  • RQ2最近邻数量如何影响光伏功率预测中概率预测区间的可靠性和准确性?
  • RQ3与传统方法相比,该方法在应用于复杂模型(如SVR和ANN)时是否能生成更准确、更可靠的预测区间?
  • RQ4在基于k-NN的分位数回归框架下,不同回归技术(多项式、ANN、SVR)的性能如何比较?
  • RQ5所得预测区间在多大程度上能维持名义覆盖率,并避免产生平凡或低估的预测?

主要发现

  • 基于k-NN的方法通过转换训练数据,成功使标准回归模型执行分位数回归,避免了对不可微分位数损失函数的直接优化。
  • 支持向量回归(SVR)生成了最准确的分位数回归和区间预测,尽管训练时间显著更长(约24分钟完成99个分位数)。
  • 多项式模型在极短训练时间(约1分钟完成99个分位数)内达到可接受的性能,适用于实时应用。
  • 人工神经网络(ANN)训练99个分位数回归约需12分钟,表现出准确性和计算成本之间的良好平衡。
  • 对于覆盖率高于0.3的情况,预测区间表现出较低的可靠性偏差,表明在不同名义覆盖率下性能一致。
  • 该方法有效防止了平凡的区间预测,表现为覆盖率高于0.4时分位数损失较低,且低覆盖率下观测分位数超出区间的比例较高,证实了非平凡区间的生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。