Skip to main content
QUICK REVIEW

[论文解读] Applying k-nearest neighbors to time series forecasting : two new approaches

Samya Tajmouati, Bouazza El Wahbi|arXiv (Cornell University)|Mar 26, 2021
Stock Market Forecasting Methods参考文献 13被引用 15
一句话总结

本文提出了两种用于时间序列预测的新型k近邻(k-NN)方法:加权近邻中的经典参数调优(CPTO-WNN)与加权近邻中的快速参数调优(FPTO-WNN)。CPTO-WNN 将最近的子序列与所有长度相同的过去子序列进行比较以选择邻居,而 FPTO-WNN 通过缩小搜索空间来降低计算成本。两种方法均采用受交叉验证启发的调优过程,以确定最优的k值和特征选择,在美国零售和英国乳制品生产的真实数据上,其预测精度显著优于 SARIMA、Holt-Winters 和 ETS 模型。

ABSTRACT

K-nearest neighbors algorithm is one of the prominent techniques used in classification and regression. Despite its simplicity, the k-nearest neighbors has been successfully applied in time series forecasting. However, the selection of the number of neighbors and feature selection is a daunting task. In this paper, we introduce two methodologies to forecasting time series that we refer to as Classical Parameters Tuning in Weighted Nearest Neighbors and Fast Parameters Tuning in Weighted Nearest Neighbors. The first approach uses classical parameters tuning that compares the most recent subsequence with every possible subsequence from the past of the same length. The second approach reduces the neighbors' search set, which leads to significantly reduced grid size and hence a lower computational time. To tune the models' parameters, both methods implement an approach inspired by cross-validation for weighted nearest neighbors. We evaluate the forecasting performance and accuracy of our models. Then, we compare them to some classical approaches, especially, Seasonal Autoregressive Integrated Moving Average, Holt-Winters and Exponential Smoothing State Space Model. Real data examples on retail and food services sales in the USA and milk production in the UK are analyzed to demonstrate the application and the efficiency of the proposed approaches.

研究动机与目标

  • 解决在时间序列预测中k-NN方法选择最优k值与特征的挑战,该问题显著影响模型性能。
  • 通过限制邻居搜索集合来降低基于k-NN的预测计算负担,同时不牺牲准确性。
  • 利用受交叉验证启发的方法,开发自动且稳健的加权k-NN模型参数调优程序。
  • 在真实世界数据集上,将所提方法与 SARIMA、Holt-Winters 和 ETS 等经典时间序列模型进行对比评估。
  • 在包括零售销售额与乳制品生产在内的多样化时间序列数据上,展示所提方法的有效性与高效性。

提出的方法

  • CPTO-WNN 对最近的子序列与所有可能的相同长度过去子序列进行全面比较,以识别k个最近邻。
  • FPTO-WNN 通过显著缩小邻居搜索集合来降低计算时间,同时保持预测准确性。
  • 两种方法均采用改进的交叉验证技术,通过在测试集上最小化平均误差来调优邻居数量(k)并选择相关特征。
  • 预测基于k个最近邻子序列的下一个值的加权平均,其中权重与距离成反比。
  • 特征选择被整合到调优过程中,以聚焦于信息丰富的子序列,从而提升模型性能。
  • 方法应用于真实数据集:美国零售与食品服务销售额及英国奶牛乳制品生产数据,以MAPE作为主要准确率指标。

实验结果

研究问题

  • RQ1系统性的参数调优方法是否能通过优化k值与特征选择,提升k-NN在时间序列预测中的性能?
  • RQ2k-NN中完整邻居搜索的计算成本如何影响可扩展性?是否能在不降低准确率的前提下减少计算成本?
  • RQ3所提出的CPTO-WNN与FPTO-WNN方法在准确率与效率方面,相较于SARIMA、Holt-Winters与ETS等经典模型表现如何?
  • RQ4所提出的受交叉验证启发的调优程序是否能持续优于默认或启发式参数选择,带来更优的预测结果?
  • RQ5模型性能在不同预测时域下如何变化?哪种方法在更长时域下仍保持鲁棒性?

主要发现

  • 在美国零售与食品服务销售额数据上,CPTO-WNN 在多个预测时域下,其MAPE表现优于FPTO-WNN、SARIMA、Holt-Winters与ETS。
  • 在英国乳制品生产数据集上,CPTO-WNN与FPTO-WNN在所有时域下均显著优于SARIMA、Holt-Winters与ETS,其中FPTO-WNN展现出最低的计算成本。
  • 对于美国零售数据,CPTO-WNN在第7期预测时达到最低MAPE(1.285574),而FPTO-WNN为1.371099,两者均优于ETS(1.519837)与SARIMA(1.588464)。
  • 在美国零售数据中,Holt-Winters方法在第1期与第2期预测时未能收敛,表明在所提出的调优框架下存在不稳定性。
  • 随着预测时域的增加,所有模型的MAPE均上升,但CPTO-WNN与FPTO-WNN的误差率仍显著低于经典模型。
  • 由于邻居搜索空间更小,FPTO-WNN在计算上比CPTO-WNN更高效,因此更适合大规模或实时应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。