Skip to main content
QUICK REVIEW

[论文解读] Forecasting with sktime: Designing sktime's New Forecasting API and Applying It to Replicate and Extend the M4 Study

Markus Löning, Franz J. Király|arXiv (Cornell University)|May 16, 2020
Forecasting Techniques and Applications参考文献 70被引用 4
一句话总结

本文介紹了 sktime 的新時間序列預測 API,這是一套與 scikit-learn 兼容的框架,用於建立、調優和評估單變量時間序列預測的複合機器學習模型。該研究重現並擴展了 M4 預測研究,表明簡單的混合模型與純機器學習方法可超越統計模型,並接近 M4 競賽頂尖模型的表現,特別是在小時級數據上表現尤為突出。

ABSTRACT

We present a new open-source framework for forecasting in Python. Our framework forms part of sktime, a more general machine learning toolbox for time series with scikit-learn compatible interfaces for different learning tasks. Our new framework provides dedicated forecasting algorithms and tools to build, tune and evaluate composite models. We use sktime to both replicate and extend key results from the M4 forecasting study. In particular, we further investigate the potential of simple off-the-shelf machine learning approaches for univariate forecasting. Our main results are that simple hybrid approaches can boost the performance of statistical models, and that simple pure approaches can achieve competitive performance on the hourly data set, outperforming the statistical algorithms and coming close to the M4 winner.

研究动机与目标

  • 解決時間序列預測中缺乏開源、與 scikit-learn 兼容的工具包,以用於建立、調優和評估複合機器學習模型的問題。
  • 提供一個可組合、模塊化的預測 API,支援資料管道、超參數調優以及元預測技術(如降維與去趨勢化)。
  • 使用標準化、開源的框架重現並驗證 M4 預測競賽的結果。
  • 透過在單變量預測任務上評估現成的機器學習方法(如降維、提升與超參數調優),擴展 M4 研究。
  • 證明簡單的現成機器學習模型可達成競爭性表現,與統計模型比肩,甚至超越,並接近 M4 競賽冠軍的準確度。

提出的方法

  • 在 sktime 中設計一個與 scikit-learn 的估計器介面一致的預測 API,使時間序列的估計器、轉換器與資料管道能一致使用。
  • 實現元預測器(如降維,即將預測問題轉化為回歸問題)、去趨勢化與殘差提升等技術,以支援混合建模。
  • 使用嵌套時間序列交叉驗證與時間序列分割方式,對機器學習模型(如隨機森林、XGBoost、KNN、線性回歸)的超參數進行調優。
  • 應用資料管道技術,將特徵工程、模型擬合與預測步驟整合為可重用、可組合的工作流程。
  • 使用相同的資料分割與評估指標(MASE、sMAPE)重現 M4 研究結果,以驗證實現的正確性。
  • 透過在所有 M4 頻率類別(從年度到小時級)上評估新模型配置(包括調優與混合模型),擴展 M4 研究。

实验结果

研究问题

  • RQ1sktime 的新預測 API 是否能使用現成的機器學習模型準確重現 M4 預測競賽的結果?
  • RQ2在 M4 基準測試中,與統計模型相比,簡單的現成機器學習模型(如隨機森林、XGBoost)在單變量時間序列預測中的表現如何?
  • RQ3混合方法(如對統計模型的殘差進行提升)能在多大程度上提升預測準確度?
  • RQ4簡單的模型調優與組合技術(如資料管道、降維)是否能顯著提升在具有挑戰性的 M4 數據集(特別是小時級數據)上的表現?
  • RQ5純機器學習模型的表現與 M4 競賽冠軍相比如何,特別是在小時級預測任務上?

主要发现

  • M4 研究的重現結果顯示,基線模型無顯著差異,統計模型僅有微小差異,但使用 sktime 實作時,機器學習模型表現有顯著提升。
  • 簡單的混合模型(如使用機器學習對統計模型的殘差進行提升)顯著提升了準確度,特別是在日級與週級數據集上表現尤為突出。
  • 純機器學習模型——特別是調優後的隨機森林與 XGBoost——在小時級數據集上表現具有競爭力,超越所有統計模型,並接近 M4 冠軍的表現。
  • 調優後的 XGBoost-s 模型在所有 M4 數據集上取得 OWA 為 1.131,而調優後的隨機森林(RF-t-s)取得 1.047,顯示其在不同頻率上的強大泛化能力。
  • 在小時級數據集上,表現最佳的模型(XGB-t-s)取得 OWA 為 0.746,顯著超越統計模型,並接近 M4 冠軍的表現。
  • 線性回歸模型表現不穩定,因預測值爆炸而被排除在結果之外,特別是在低頻率數據序列上,突顯了單變量情境下線性外推的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。