[논문 리뷰] MambaTS: Improved Selective State Space Models for Long-term Time Series Forecasting
MambaTS는 선택적 상태 공간 모델을 변수 인식 스캐닝 및 순열 전략으로 확장하여 선형 복잡도와 함께 최첨단의 장기 다변량 시계열 예측을 달성합니다.
In recent years, Transformers have become the de-facto architecture for long-term sequence forecasting (LTSF), but faces challenges such as quadratic complexity and permutation invariant bias. A recent model, Mamba, based on selective state space models (SSMs), has emerged as a competitive alternative to Transformer, offering comparable performance with higher throughput and linear complexity related to sequence length. In this study, we analyze the limitations of current Mamba in LTSF and propose four targeted improvements, leading to MambaTS. We first introduce variable scan along time to arrange the historical information of all the variables together. We suggest that causal convolution in Mamba is not necessary for LTSF and propose the Temporal Mamba Block (TMB). We further incorporate a dropout mechanism for selective parameters of TMB to mitigate model overfitting. Moreover, we tackle the issue of variable scan order sensitivity by introducing variable permutation training. We further propose variable-aware scan along time to dynamically discover variable relationships during training and decode the optimal variable scan order by solving the shortest path visiting all nodes problem during inference. Extensive experiments conducted on eight public datasets demonstrate that MambaTS achieves new state-of-the-art performance.
연구 동기 및 목표
- 효율적이고 확장 가능한 모델을 넘어서는 Transformer를 보완한 장기 다변량 시계열 예측의 필요성 제고.
- LTSF에서 Mamba의 한계점을 조사하고 글로벌 및 변수 의존성을 개선하기 위한 표적 강화책을 개발합니다.
- 상태-최적의 결과를 달성하기 위한 혁신(VST, TMB, 선택적 매개변수에 대한 dropout, VPT, VAST)의 모음집을 제안합니다.
- 여덟 개 공공 LTSF 데이터셋에서 확장성과 경쟁력 있는 성능을 입증합니다.
제안 방법
- VST(Variable Scan along Time)을 채택하여 같은 타임스텝에서 서로 다른 변수의 토큰을 번갈아 섞어 글로벌 회상 시퀀스를 형성합니다.
- Mamba의 인과 컨볼루션을 제거하고 SSM 앞의 지역 컨볼루션을 제거하여 Temporal Mamba Block(TMB)으로 대체합니다.
- TMB 내에서 선택적 매개변수에 대한 dropout을 도입하여 과적합을 완화합니다.
- VPT(Variable Permutation Training)를 적용하여 알려지지 않은 변수 순서에 대한 민감성을 줄이고 지역 상호작용 능력을 향상시킵니다.
- VAST(Variable-Aware Scan along Time)를 개발하여 변수 관계를 추정하고 추론 중에 시뮬레이티드 어닐링 해를 사용한 비대칭 여행하는 외판원 문제(ATSP) 해결책으로 최적의 변수 스캔 순서를 추론합니다.
- Training 중 안정성을 위해 채널별 디코딩 헤드를 유지하고 RevIN에서 영감을 받은 인스턴스 정규화를 사용합니다.
실험 결과
연구 질문
- RQ1다항 시계열에서 이차 복잡도 없이 대규모 의존성을 효율적으로 모델링하기 위해 Mamba 기반 아키텍처를 적용할 수 있는가?
- RQ2변수 순서 민감성과 로컬 컨텍스트 상호작용이 LTSF에서 Mamba를 제한하고, 순열 및 변수 인식 전략이 이러한 문제를 완화할 수 있는가?
- RQ3데이터 기반의 추론 시 최적 변수 스캔 순서가 고정되거나 무작위로 섞인 순서보다 LTSF 성능을 향상시키는가?
- RQ4LTSF를 위한 temporal blocks에서 인과 컨볼루션을 제거하는 것이 미치는 영향은 무엇이며, 선택적 Mamba 블록에서 dropout이 과적합을 방지하는 데 도움이 되는가?
- RQ5제안된 구성 요소들이 다양한 LTSF 데이터셋에서 최첨단 결과를 도출하는 방식은 어떠한가?
주요 결과
- MambaTS는 대부분의 장기 다변량 예측 과제에서 새로운 최첨단 성능을 달성합니다(여덟 개의 공공 데이터세트 중).
- VST는 모든 변수의 이력을 집계하여 글로벌 회상 표현을 가능하게 합니다.
- Temporal Mamba Block(TMB)는 인과 컨볼루션 없이 시간 모델링의 효율성을 개선하고 dropout과 함께 과적합을 줄입니다.
- VPT(Variable Permutation Training) 및 VAST(Variable-Aware Scan along Time)는 변수 순서에 대한 민감성을 크게 완화하고 로컬 상호작용 능력을 향상시킵니다.
- VAST는 학습된 코스트 매트릭스를 사용하여 시뮬레이티드 어닐링 ATSP 해법을 안내하고 추론 시 효과적인 스캔 순서를 제공합니다.
- 전반적으로 MambaTS는 시퀀스 길이에 선형인 계산 복잡도와 트랜스포머 기반 및 다른 기준선 대비 강력한 실증 성능을 달성합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.