Skip to main content
QUICK REVIEW

[论文解读] Hierarchically Regularized Deep Forecasting

Biswajit Paria, Rajat Sen|arXiv (Cornell University)|Jun 14, 2021
Time Series Analysis and Forecasting参考文献 47被引用 6
一句话总结

该论文提出HiReD,一种可扩展的深度分层预测模型,结合了时变自回归(TVAR)组件与基于基函数分解(BD)模型,并通过正则化手段强制实现分层一致性。通过基于基函数建模预测并应用时变系数,该方法在无需后处理或大批次训练的情况下,实现了所有分层级别上的最先进准确率与更优的一致性。

ABSTRACT

Hierarchical forecasting is a key problem in many practical multivariate forecasting applications - the goal is to simultaneously predict a large number of correlated time series that are arranged in a pre-specified aggregation hierarchy. The main challenge is to exploit the hierarchical correlations to simultaneously obtain good prediction accuracy for time series at different levels of the hierarchy. In this paper, we propose a new approach for hierarchical forecasting which consists of two components. First, decomposing the time series along a global set of basis time series and modeling hierarchical constraints using the coefficients of the basis decomposition. And second, using a linear autoregressive model with coefficients that vary with time. Unlike past methods, our approach is scalable (inference for a specific time series only needs access to its own history) while also modeling the hierarchical structure via (approximate) coherence constraints among the time series forecasts. We experiment on several public datasets and demonstrate significantly improved overall performance on forecasts at different levels of the hierarchy, compared to existing state-of-the-art hierarchical models.

研究动机与目标

  • 解决在零售或电网等应用中,大量相关联的时间序列按分层树状结构排列的预测挑战。
  • 克服现有方法(如事后校正或图神经网络GNN)的局限性——这些方法或存在不一致性、或不可扩展、或需要全批量训练。
  • 开发一种单阶段、端到端可训练的模型,通过强制实施加法一致性约束来保持各分层级别的一致性,同时维持可扩展性。
  • 确保任一时间序列的推理仅依赖于其自身历史数据,从而支持高效的最小批量训练与部署。
  • 通过利用全局时间模式与局部动态,提升分层中所有级别(尤其是聚合的粗粒度时间序列)的预测准确率。

提出的方法

  • 将每个时间序列分解为通过基函数分解(BD)学习到的全局基函数的线性组合,以捕捉分层结构中共享的时间模式。
  • 利用时变自回归(TVAR)机制建模基函数分解的系数,使其能够适应局部动态并实现序列特定的预测。
  • 引入一种分层正则化项,惩罚与加法一致性偏离的情况,确保父节点预测值等于其子节点预测值之和。
  • 将完整目标函数表述为结合重构误差与分层正则化的可微分损失,支持通过随机梯度下降进行端到端训练。
  • 采用两阶段训练策略:首先在所有时间序列上预训练BD模型,然后联合微调BD系数与TVAR参数,并引入分层正则化。
  • 通过解耦每个时间序列的推理过程实现可扩展性——仅需访问其自身的历史数据,而无需整个分层结构。

实验结果

研究问题

  • RQ1深度学习模型能否在多级时间序列分层结构的所有层级上,同时实现高预测准确率与强分层一致性?
  • RQ2与标准RNN或GNN模型相比,引入具有时变系数的基函数分解是否能提升泛化能力与可扩展性?
  • RQ3分层正则化在不降低准确率的前提下,能在多大程度上增强预测一致性,尤其是在聚合层级?
  • RQ4在多种数据集上,该模型在准确率(WAPE/SMAPE)与一致性度量方面,相较于最先进基线模型表现如何?
  • RQ5该模型能否在不依赖推理时访问分层中所有时间序列的情况下,实现高效的最小批量训练?

主要发现

  • HiReD在M5、Favorita和Tourism数据集上均达到最先进性能,M5数据集上平均WAPE为0.113,Favorita数据集上为0.030,优于所有基线模型。
  • 消融实验表明,若移除分层正则化($\lambda_E=0$)或BD组件,准确率将显著下降,证实了两个组件的重要性。
  • 与RNN基线相比,HiReD将一致性偏差降低了高达70%,在Favorita数据集的Level 0层级,预测值与一致目标值之间的WAPE从0.043降至0.004。
  • BD学习到的基函数捕捉到了主导的全局模式——特别是周期为7的周循环模式,如M5验证集中的可视化所示。
  • 在叶节点层级(如Level 3),TVAR组件主导最终预测结果,表明在细粒度层级上,局部动态比全局模式更为关键。
  • 该模型在所有分层级别上均保持强劲性能,准确率与一致性均持续提升,尤其在更高(更粗粒度)层级表现显著,该层级的聚合误差影响最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。