[논문 리뷰] Bi-Mamba+: Bidirectional Mamba for Time Series Forecasting
Bi-Mamba4TS는 채널 비의존성과 채널 혼합 토큰화를 자동으로 선택하기 위해 시퀀스-관계 인식 SRA 디시더를 갖춘 양방향 Mamba 인코더를 제안하여 장기 다변량 시계열 예측을 위한 패칭으로 로컬 정보를 풍부하게 활용한다.
Long-term time series forecasting (LTSF) provides longer insights into future trends and patterns. Over the past few years, deep learning models especially Transformers have achieved advanced performance in LTSF tasks. However, LTSF faces inherent challenges such as long-term dependencies capturing and sparse semantic characteristics. Recently, a new state space model (SSM) named Mamba is proposed. With the selective capability on input data and the hardware-aware parallel computing algorithm, Mamba has shown great potential in balancing predicting performance and computational efficiency compared to Transformers. To enhance Mamba's ability to preserve historical information in a longer range, we design a novel Mamba+ block by adding a forget gate inside Mamba to selectively combine the new features with the historical features in a complementary manner. Furthermore, we apply Mamba+ both forward and backward and propose Bi-Mamba+, aiming to promote the model's ability to capture interactions among time series elements. Additionally, multivariate time series data in different scenarios may exhibit varying emphasis on intra- or inter-series dependencies. Therefore, we propose a series-relation-aware decider that controls the utilization of channel-independent or channel-mixing tokenization strategy for specific datasets. Extensive experiments on 8 real-world datasets show that our model achieves more accurate predictions compared with state-of-the-art methods.
연구 동기 및 목표
- 장기 다변량 시계열 예측(LTSF)을 동기를 부여하고 트랜스포머의 효율성과 정확도 간의 트레이드오프를 다룬다.
- 선형 시간 복잡도와 장거리 의존성 모델링을 위해 Mamba와 함께 상태 공간 모델(SSM)을 활용한다.
- 피어슨 상관관계에 기초한 Series-Relation-Aware(SRA) 디시더를 통해 토큰화 전략 선정을 자동화한다.
- 패칭을 통해 더 세밀한 진화 패턴을 포착하여 시계열 표현을 풍부하게 한다.
- 7개 실제 데이터셋에서 최첨단 기준모델보다 우수한 예측 성능을 입증한다.
제안 방법
- 입력 시계열을 패치로 분할하여 패치 단위 토큰을 얻는다.
- 피어슨 상관관계에 따라 채널 비의존 토큰화와 채널 혼합 토큰화 중 자동으로 선택하는 Series-Relation-Aware(SRA) 디시더를 사용한다.
- 포워드 및 백워드 가지가 있는 양방향 Mamba 인코더를 적용하여 시계열 간의 의존성과 개별 시계열 내 의존성을 모델링한다.
- 비정상성 입력을 정규화하고 출력을 비정규화하기 위해 RevIN을 적용한다.
- MSE 손실로 학습하고 여러 인코더 계층에 걸쳐 조기 종료를 포함한 ADAM 최적화를 사용한다.
실험 결과
연구 질문
- RQ1데이터 기반 디시더가 서로 다른 MTS 데이터셋에 맞게 채널 비의존 토큰화와 채널 혼합 토큰화를 효과적으로 선택할 수 있는가?
- RQ2패치 기반 토큰화와 양방향 Mamba의 결합이 Transformer 기반 및 다른 SSM 기반 모델들보다 장기 예측 정확도를 향상시키는가?
- RQ3MTS 데이터에서 내부 시계열 간 의존성과 외부 시계열 간 의존성 모델링에 대한 양방향 설계의 영향은 무엇인가?
- RQ4다양한 실제 데이터셋에 대한 초매개변수 변화에 대한 Bi-Mamba4TS의 강건성은 어느 정도인가?
주요 결과
- Bi-Mamba4TS는 7개 실제 데이터셋에서 다양한 예측 구간에 대해 강력한 기준모델들과 비교해 우수한 예측 정확도를 달성한다.
- 모델은 iTransformer 대비 MSE/MAE를 각각 평균 4.92%와 2.16%의 차이로 감소시킨다.
- Weather, Traffic, Electricity 데이터셋에서 채널 혼합을 사용하고 네 개의 ETT 데이터셋에서 채널 비의존화를 사용함으로써 데이터셋 의존적 이득이 나타난다.
- 절삭 연구에서 SRA 디시더와 양방향 Mamba가 성능 향상에 의미 있게 기여함을 보여준다.
- SRA 디시더 또는 역방향 Mamba 가지를 제거하면 성능이 저하되어 전략 선택과 양방향성의 중요성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.