Skip to main content
QUICK REVIEW

[论文解读] MQTransformer: Multi-Horizon Forecasts with Context Dependent and Feedback-Aware Attention

Carson Eisenach, Yagna Patel|arXiv (Cornell University)|Sep 30, 2020
Traffic Prediction and Management Techniques被引用 10
一句话总结

MQTransformer 提出了一种基于 Transformer 的新型架构,用于多时间跨度时间序列预测,通过上下文相关的位置编码、针对时间跨度的解码器-编码器注意力机制以及反馈感知的自注意力机制,提升了预测精度并降低了预测波动性。在高峰时段,其分位数损失降低了 33%,在 P50 处的过度波动性减少了 67%,在公开基准测试中优于最先进的模型(如 TFT 和 MQ-CNN)。

ABSTRACT

Recent advances in neural forecasting have produced major improvements in accuracy for probabilistic demand prediction. In this work, we propose novel improvements to the current state of the art by incorporating changes inspired by recent advances in Transformer architectures for Natural Language Processing. We develop a novel decoder-encoder attention for context-alignment, improving forecasting accuracy by allowing the network to study its own history based on the context for which it is producing a forecast. We also present a novel positional encoding that allows the neural network to learn context-dependent seasonality functions as well as arbitrary holiday distances. Finally we show that the current state of the art MQ-Forecaster (Wen et al., 2017) models display excess variability by failing to leverage previous errors in the forecast to improve accuracy. We propose a novel decoder-self attention scheme for forecasting that produces significant improvements in the excess variation of the forecast.

研究动机与目标

  • 为解决最先进多时间跨度预测模型中存在的过度预测波动性问题,这些模型无法从过去的预测误差中学习。
  • 通过将上下文相关的季节性特征和针对时间跨度的表示融入注意力机制,提升预测精度。
  • 设计一种神经网络架构,学习适用于概率时间序列预测的正确归纳偏置,同时不牺牲计算效率。
  • 使模型能够基于预测上下文和历史误差模式动态调整其注意力机制,从而改善预测演化过程。
  • 证明降低预测波动性和提升预测精度并非权衡取舍,而是可以通过架构创新同时实现。

提出的方法

  • 提出一种源自领域特定事件指标(如节假日、促销活动)的新位置编码方法,用于学习上下文相关的季节性函数。
  • 提出针对时间跨度的解码器-编码器注意力机制,使解码器能够针对每个预测时间跨度关注相应的编码器状态,从而提升表征保真度。
  • 设计一种反馈感知的解码器自注意力机制,使模型能够整合过去预测误差的知识,从而减少过度波动性。
  • 采用分叉序列训练方式,对所有可用轨迹(如零售数据集中 2000 万条)进行训练,实现无需下采样即可充分利用全部数据。
  • 使用单一目标函数(分位数损失)进行训练,不依赖显式正则化来控制波动性,而是通过架构设计实现更高的稳定性。
  • 采用基于 Transformer 的注意力机制,并针对时间序列预测任务调整归纳偏置,与自然语言处理应用中的方法有明显区别。

实验结果

研究问题

  • RQ1基于 Transformer 的架构能否通过学习自身历史误差来降低预测波动性?
  • RQ2上下文相关的相对位置编码能否在固定节假日距离之外,更有效地建模复杂季节性模式?
  • RQ3针对时间跨度的注意力机制是否能提升促销或季节性高峰等子问题的预测精度?
  • RQ4注意力机制的架构创新能否在不产生权衡的情况下,同时提升预测精度并减少过度波动性?
  • RQ5诸如反馈感知自注意力等架构选择,在多时间跨度预测中是否显著优于标准注意力机制?

主要发现

  • 与基线模型 MQ-Forecaster 相比,MQTransformer 在 P50 分位数处将过度预测波动性降低了 67%,在 P90 处降低了 95%。
  • 在最具挑战性的零售预测任务中,MQTransformer 在 P50 分位数处相比之前最先进模型(TFT)提升了 38%,在 P90 处提升了 11%。
  • 全年整体 P90 分位数损失降低了 5.5%,在高峰时段最高提升达 33%。
  • MQTransformer 在单张 V100 GPU 上每轮训练仅需 5 分钟,可处理 2000 万条轨迹,优于 TFT(每轮 13 分钟),并实现了完整数据利用。
  • 即使在仅使用 45 万条轨迹的子样本上重新训练,且未使用分叉序列,MQTransformer 的性能仍与在全部数据上训练的 MQ-CNN 基线模型相当。
  • MQTransformer 在四个公开数据集(包括电力负荷、波动率和交通预测任务)上,表现与最先进模型(DeepAR、ConvTrans、MQ-RNN、TFT)持平或更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。