[论文解读] Are Self-Attentions Effective for Time Series Forecasting?
该论文提出CATS,一种新颖的时间序列预测模型,通过将自注意力机制替换为交叉注意力机制,将未来的预测时域视为可学习的查询,将过去的序列视为键/值。通过消除自注意力机制并强制实现时域特定的参数共享,CATS在多个数据集上实现了最先进的性能,相较于现有的基于Transformer的模型,其均方误差(MSE)更低,参数量显著更少。
Time series forecasting is crucial for applications across multiple domains and various scenarios. Although Transformer models have dramatically advanced the landscape of forecasting, their effectiveness remains debated. Recent findings have indicated that simpler linear models might outperform complex Transformer-based approaches, highlighting the potential for more streamlined architectures. In this paper, we shift the focus from evaluating the overall Transformer architecture to specifically examining the effectiveness of self-attention for time series forecasting. To this end, we introduce a new architecture, Cross-Attention-only Time Series transformer (CATS), that rethinks the traditional Transformer framework by eliminating self-attention and leveraging cross-attention mechanisms instead. By establishing future horizon-dependent parameters as queries and enhanced parameter sharing, our model not only improves long-term forecasting accuracy but also reduces the number of parameters and memory usage. Extensive experiment across various datasets demonstrates that our model achieves superior performance with the lowest mean squared error and uses fewer parameters compared to existing models. The implementation of our model is available at: https://github.com/dongbeank/CATS.
研究动机与目标
- 探究自注意力机制在有效时间序列预测中是否真正必要。
- 解决由于排列不变性及二次方复杂度导致的自注意力机制效率低下和潜在信息损失问题。
- 设计一种简化版的Transformer架构,在保持高预测精度的同时减少模型大小和内存占用。
- 通过交叉注意力实现时域相关参数共享,提升长期预测性能。
- 通过为每个预测时域提供独立的注意力图,提升模型可解释性。
提出的方法
- CATS将Transformer中的所有自注意力层替换为交叉注意力,使用未来的预测时域作为查询。
- 每个预测时域被视为独立的查询向量,支持时域特定的注意力计算。
- 模型采用基于补丁的输入表示方法,使用非重叠补丁,并对通道进行独立处理。
- 通过在不同时间域之间共享查询嵌入,进一步增强参数共享,降低模型复杂度。
- 在查询(未来时域)与键/值(过去时间序列补丁)之间应用多头交叉注意力。
- 模型采用标准回归损失进行端到端训练,注意力图被可视化以解释周期性模式的学习过程。

实验结果
研究问题
- RQ1自注意力机制在准确的时间序列预测中是否必不可少?能否被更简单的机制替代?
- RQ2仅使用交叉注意力是否能在长期预测性能上超越基于自注意力的Transformer模型?
- RQ3消除自注意力机制是否能在不损失预测准确率的前提下降低模型复杂度?
- RQ4通过时域特定的查询是否能提升长期预测中的可解释性与性能?
- RQ5交叉注意力在捕捉时间序列中的周期性模式方面是否高效?
主要发现
- CATS在所有评估的数据集中均实现了最低的均方误差(MSE),包括ETTm1和Electricity数据集,优于现有的基于Transformer的模型。
- 在720步预测时域的ETTm1数据集中,CATS的MSE为0.400,显著低于采用自注意力机制的模型(例如,两层自注意力机制的模型MSE为0.442)。
- CATS的参数量少于所有对比模型,在图1中显示为最小的气泡尺寸,表明其具有卓越的参数效率。
- 在合成数据中,模型成功捕捉了周期性模式,注意力得分图清晰显示出24步周期性特征及异常事件检测。
- 可视化结果表明,高注意力补丁表现出相似的时间模式,证明了模型检测序列与周期性结构的能力。
- CATS为每个预测时域提供可解释的注意力图,使每个预测结果如何从历史数据中推导得出的过程得以清晰分析。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。