[논문 리뷰] Are Self-Attentions Effective for Time Series Forecasting?
이 논문은 CATS를 제안하며, 미래 예측 수평선을 학습 가능한 쿼리로 간주하고 과거 시계열을 키/값으로 삼아 자기주의(self-attention)를 교차주의(cross-attention)로 대체하는 새로운 시계열 예측 모델을 개발한다. 자기주의를 제거하고 수평선별 파rameter 공유를 강제함으로써, CATS는 다양한 데이터셋에서 기존의 Transformer 기반 모델보다 더 낮은 MSE와 훨씬 적은 파라미터를 사용하여 최신 기술(SOTA) 성능을 달성한다.
Time series forecasting is crucial for applications across multiple domains and various scenarios. Although Transformer models have dramatically advanced the landscape of forecasting, their effectiveness remains debated. Recent findings have indicated that simpler linear models might outperform complex Transformer-based approaches, highlighting the potential for more streamlined architectures. In this paper, we shift the focus from evaluating the overall Transformer architecture to specifically examining the effectiveness of self-attention for time series forecasting. To this end, we introduce a new architecture, Cross-Attention-only Time Series transformer (CATS), that rethinks the traditional Transformer framework by eliminating self-attention and leveraging cross-attention mechanisms instead. By establishing future horizon-dependent parameters as queries and enhanced parameter sharing, our model not only improves long-term forecasting accuracy but also reduces the number of parameters and memory usage. Extensive experiment across various datasets demonstrates that our model achieves superior performance with the lowest mean squared error and uses fewer parameters compared to existing models. The implementation of our model is available at: https://github.com/dongbeank/CATS.
연구 동기 및 목표
- 자기주의 메커니즘이 효과적인 시계열 예측을 위해 진정으로 필수적인가를 조사하는 것.
- 순열 불변성과 제곱형 복잡도로 인한 비효율성과 잠재적 정보 손실 문제를 해결하기 위한 것.
- 높은 예측 정확도를 유지하면서 모델 크기와 메모리 사용량을 줄이는 간소화된 Transformer 아키텍처를 설계하는 것.
- 교차주의를 통해 수평선별 파라미터 공유를 가능하게 하여 장기 예측 성능을 향상시키는 것.
- 각 예측 수평선별로 개별적인 주의 맵(attention map)을 허용하여 해석 가능성(interpretability)을 향상시키는 것.
제안 방법
- CATS는 Transformer 내 모든 자기주의 레이어를 교차주의로 대체하며, 미래 예측 수평선을 쿼리로 사용한다.
- 각 예측 수평선은 독립적인 쿼리 벡터로 간주되어 수평선별 주의 계산이 가능해진다.
- 모델은 겹치지 않는 패치 기반 입력 표현 방식을 사용하며, 채널 간 독립적인 처리를 수행한다.
- 다양한 수평선 간 쿼리 임베딩을 연결함으로써 파라미터 공유를 강화하여 모델 복잡도를 감소시킨다.
- 쿼리(미래 수평선)와 키/값(과거 시계열 패치) 간에 다중 헤드 교차주의가 적용된다.
- 모델은 표준 회귀 손실을 사용해 엔드 투 엔드로 훈련되며, 주의 맵은 주기적 패턴 학습을 해석하기 위해 시각화된다.

실험 결과
연구 질문
- RQ1정확한 시계열 예측을 위해 자기주의가 진정으로 필수적인가, 아니면 더 단순한 메커니즘으로 대체될 수 있는가?
- RQ2자기주의 기반 Transformer와 비교해 교차주의만으로도 장기 예측 성능이 뛰어나게 구현될 수 있는가?
- RQ3자기주의를 제거함으로써 예측 정확도를 희생시키지 않고도 모델 복잡도를 줄일 수 있는가?
- RQ4수평선별 쿼리가 장기 수평선 예측에서 성능 향상과 해석 가능성 향상에 기여하는가?
- RQ5교차주의가 시계열 데이터의 주기적 패턴을 얼마나 효과적으로 포착할 수 있는가?
주요 결과
- CATS는 평가된 모든 데이터셋에서 가장 낮은 평균 제곱 오차(MSE)를 기록했으며, ETTm1 및 Electricity 데이터셋에서도 기존의 Transformer 기반 모델을 능가했다.
- 720단계 수평선을 가진 ETTm1 데이터셋에서 CATS는 MSE 0.400을 기록했으며, 자기주의를 사용하는 모델들(예: 두 개의 자기주의 레이어를 가진 경우 0.442)보다 유의미하게 낮았다.
- CATS는 비교된 모든 모델보다 더 적은 파라미터를 사용했으며, 그림 1에서 가장 작은 버블 크기를 보여, 뛰어난 파라미터 효율성을 입증했다.
- 시뮬레이션 데이터에서 주기적 패턴을 성공적으로 포착했으며, 주의 점수 맵을 통해 24단계 주기성과 충격 감지 기능을 확인할 수 있었다.
- 시각화 결과, 고주의 주의 패치는 유사한 시간적 패턴을 보였으며, 이는 모델이 순차적이고 주기적인 구조를 탐지할 수 있음을 보여주었다.
- CATS는 각 예측 수평선별로 해석 가능한 주의 맵을 제공하여, 각 예측이 과거 데이터로부터 어떻게 유도되는지 명확히 분석할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.