[论文解读] Timer-XL: Long-Context Transformers for Unified Time Series Forecasting
Timer-XL 通过引入多变量下一个标记预测和一种新颖的 TimeAttention 机制,提出了一种统一的、生成式的 Transformer 框架,用于长上下文时间序列预测。该机制通过双时间-变量位置嵌入捕捉因果性、跨序列和序列内依赖关系。在上下文长度达数千个标记的单变量、多变量和协变量感知预测基准上,Timer-XL 实现了最先进性能,展现出强大的泛化能力和上下文灵活性。
We present Timer-XL, a causal Transformer for unified time series forecasting. To uniformly predict multidimensional time series, we generalize next token prediction, predominantly adopted for 1D token sequences, to multivariate next token prediction. The paradigm formulates various forecasting tasks as a long-context prediction problem. We opt for decoder-only Transformers that capture causal dependencies from varying-length contexts for unified forecasting, making predictions on non-stationary univariate time series, multivariate series with complicated dynamics and correlations, as well as covariate-informed contexts that include exogenous variables. Technically, we propose a universal TimeAttention to capture fine-grained intra- and inter-series dependencies of flattened time series tokens (patches), which is further enhanced by deft position embedding for temporal causality and variable equivalence. Timer-XL achieves state-of-the-art performance across task-specific forecasting benchmarks through a unified approach. Based on large-scale pre-training, Timer-XL achieves state-of-the-art zero-shot performance, making it a promising architecture for pre-trained time series models. Code is available at this repository: https://github.com/thuml/Timer-XL.
研究动机与目标
- 解决现有时间序列 Transformer 中的上下文瓶颈问题,这些模型通常仅在最多数百个标记的有限上下文中运行,限制了其对全局趋势和非平稳性的建模能力。
- 通过多变量下一个标记预测,将单变量、多变量和协变量感知等多样化预测场景统一到一个单一的长上下文生成框架中。
- 使生成式 Transformer 能够有效建模细粒度的序列内和序列间依赖关系,同时在可变长度输入下保持因果性和上下文灵活性。
- 开发一种可扩展的、适用于所有场景的预测基础模型,支持大规模预训练和跨多样化时间序列动态与数据集的迁移学习。
提出的方法
- 提出多变量下一个标记预测作为统一范式,将所有预测任务建模为在展平的时间序列片段上进行自回归生成。
- 引入 TimeAttention,一种具有可学习掩码和时间维与变量维相对位置嵌入的因果自注意力机制,以在保持因果性的同时建模跨序列依赖关系。
- 为时间点和变量分别引入相对位置嵌入,以增强时序和变量感知建模能力,而无需修改标准自注意力机制。
- 将 Timer-XL 设计为 Timer 模型的超长上下文扩展版本,通过大规模预训练实现强大的泛化能力和可迁移性。
- 采用仅解码器的 Transformer 架构,以保持生成模型的上下文灵活性,支持任意输入和输出长度的推理。
- 通过架构和训练方面的创新,采用迭代自回归生成实现长时程预测,并妥善处理误差累积问题。
实验结果
研究问题
- RQ1统一的生成式 Transformer 框架是否能有效处理多样化的时间序列预测任务,包括单变量、多变量和协变量感知场景,并在单一范式下实现?
- RQ2将上下文长度扩展到数千个标记,是否能显著提升对非平稳性和高维时间序列的预测性能?
- RQ3与标准注意力或先前方法相比,所提出的 TimeAttention 机制在建模序列内和序列间依赖关系方面有多大提升?
- RQ4具有长上下文能力的大规模预训练生成式 Transformer 是否能有效泛化到多样化数据集和时间动态?
- RQ5自回归生成在长上下文时间序列预测中的局限性是什么?这些局限性如何被缓解?
主要发现
- Timer-XL 在多个基准测试中实现了最先进性能,包括 ETTh1、ETTh2、ETTm1、ETTm2、Weather、Solar-Energy 和 Traffic,在所有上下文长度下,MAE 和 RMSE 均有显著提升。
- 在 ETTm1 数据集上,当上下文长度为 720 时,Timer-XL 的 MAE 达到 0.164,RMSE 达到 0.258,在所有评估的上下文长度下均优于先前方法。
- 在 ETTm1 基准测试中获得 19 次第一名,在 ETTm2 中获得 17 次第一名,表明其在不同数据集上具有强大的泛化能力和鲁棒性。
- 通过大规模预训练,Timer-XL 展现出显著的模型可迁移性,实现在未见时间序列上的强大 few-shot 和 zero-shot 性能。
- 模型在多种上下文长度(96 到 720 个标记)下均保持高性能,证实其具备上下文灵活性,适合作为通用预测器。
- 大量消融实验表明,采用双位置嵌入的 TimeAttention 显著优于标准注意力和基线模型,尤其在捕捉跨序列相关性方面表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。