[论文解读] Multi-Patch Prediction: Adapting LLMs for Time Series Representation Learning
该论文提出了一种名为 aL LM4TS 的新框架,通过将预测任务重新定义为自监督的多片段预测任务,实现了大型语言模型(LLMs)在时间序列表征学习中的适配。该方法采用两阶段训练——因果下一片段预测预训练,随后进行多片段微调——并引入一种片段级解码层,以增强时间表征学习能力,在多种下游时间序列任务中实现了最先进性能,展现出优异的迁移能力。
In this study, we present aLLM4TS, an innovative framework that adapts Large Language Models (LLMs) for time-series representation learning. Central to our approach is that we reconceive time-series forecasting as a self-supervised, multi-patch prediction task, which, compared to traditional contrastive learning or mask-and-reconstruction methods, captures temporal dynamics in patch representations more effectively. Our strategy encompasses two-stage training: (i). a causal continual pre-training phase on various time-series datasets, anchored on next patch prediction, effectively syncing LLM capabilities with the intricacies of time-series data; (ii). fine-tuning for multi-patch prediction in the targeted time-series context. A distinctive element of our framework is the patch-wise decoding layer, which departs from previous methods reliant on sequence-level decoding. Such a design directly transposes individual patches into temporal sequences, thereby significantly bolstering the model's proficiency in mastering temporal patch-based representations. aLLM4TS demonstrates superior performance in several downstream tasks, proving its effectiveness in deriving temporal representations with enhanced transferability and marking a pivotal advancement in the adaptation of LLMs for time-series analysis.
研究动机与目标
- 为解决在多样化下游任务中学习通用且可迁移的时间序列表征的挑战。
- 克服传统自监督方法(如掩码重建和对比学习)在捕捉复杂时间动态方面的局限性。
- 通过一种任务特定的多片段预测范式,将 LLM 的序列建模优势适配至时间序列数据。
- 通过将片段级解码与序列级依赖关系解耦,提升表征学习能力,增强模型适应性。
- 在多个时间序列基准和任务中,展示所提框架 aL LM4TS 的卓越性能与迁移能力。
提出的方法
- 将时间序列预测重新概念化为一种自监督的多片段预测任务,取代传统的掩码重建或对比学习方法。
- 采用两阶段训练策略:(1) 在多样化时间序列数据集上使用下一片段预测进行因果连续预训练;(2) 在目标领域中进行多片段预测的微调。
- 引入一种片段级解码层,通过一个小型共享线性层独立地将每个片段解码回时间域,避免对时间关系进行序列级建模。
- 使用共享的片段级线性解码矩阵 $\mathbf{W}_p \in \mathbb{R}^{D \times P}$,与序列级解码器相比,参数量减少高达 0.34%。
- 利用 LLM 的归纳偏置实现长程序列建模,同时聚焦于片段级表征,以提升对时间动态的捕捉能力。
- 在预训练后,通过提示调优或微调技术,将 LLM 主干适配至时间序列输入。
实验结果
研究问题
- RQ1多片段预测是否可作为比掩码重建或对比学习更有效的自监督预训练目标,用于时间序列表征学习?
- RQ2与序列级解码相比,片段级解码在保留时间动态和提升模型性能方面表现如何?
- RQ3两阶段训练策略——因果下一片段预训练后接多片段微调——在提升多样化时间序列任务中的迁移能力与性能方面,效果如何?
- RQ4所提框架 aL LM4TS 是否在标准基准上实现了预测、分类和异常检测任务的最先进性能?
- RQ5与传统序列级解码器相比,片段级解码器在模型大小与训练效率方面的参数效率如何?
主要发现
- aL LM4TS 在多个时间序列基准上实现了最先进性能,包括 ETTm1 和 ETTm2,在异常检测任务上的平均 F1 得分为 87.51%,在 ETTm2 上 50% 预测时长的平均 MAE 为 0.055。
- 与序列级解码器相比,片段级解码层使解码器参数量最多减少 0.34%,显著提升了参数效率。
- 两阶段训练策略——因果下一片段预训练后接多片段微调——在所有下游任务中均表现更优,优于 GPT4TS、PatchTST 和 FEDformer 等方法。
- 在 SMD 数据集上,aL LM4TS 实现了 87.87% 的精确率、83.09% 的召回率和 85.42% 的 F1 分数,优于 GPT4TS(F1:86.72%)及其他 SOTA 模型。
- 该模型在多样化数据领域中展现出强大的零样本与 few-shot 泛化能力,证实其具备稳健的迁移能力与适应性。
- 消融实验表明,片段级解码设计通过将时间动态学习隔离于编码器,避免了解码器级序列建模的干扰,显著提升了性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。