[論文レビュー] A Mamba Foundation Model for Time Series Forecasting
TSMamba は、Mamba アーキテクチャに基づく線形計算量の基礎モデルであり、前方および後方の Mamba エンコーダーを用いて長距離時系列依存関係を捉える。2段階の転移学習プロセスとチャネル別に圧縮されたアテンションモジュールを活用することで、少ない訓練データで最先端のゼロショットおよびフルショット性能を達成する。
Time series foundation models have demonstrated strong performance in zero-shot learning, making them well-suited for predicting rapidly evolving patterns in real-world applications where relevant training data are scarce. However, most of these models rely on the Transformer architecture, which incurs quadratic complexity as input length increases. To address this, we introduce TSMamba, a linear-complexity foundation model for time series forecasting built on the Mamba architecture. The model captures temporal dependencies through both forward and backward Mamba encoders, achieving high prediction accuracy. To reduce reliance on large datasets and lower training costs, TSMamba employs a two-stage transfer learning process that leverages pretrained Mamba LLMs, allowing effective time series modeling with a moderate training set. In the first stage, the forward and backward backbones are optimized via patch-wise autoregressive prediction; in the second stage, the model trains a prediction head and refines other components for long-term forecasting. While the backbone assumes channel independence to manage varying channel numbers across datasets, a channel-wise compressed attention module is introduced to capture cross-channel dependencies during fine-tuning on specific multivariate datasets. Experiments show that TSMamba's zero-shot performance is comparable to state-of-the-art time series foundation models, despite using significantly less training data. It also achieves competitive or superior full-shot performance compared to task-specific prediction models. The code will be made publicly available.
研究の動機と目的
- 分野をまたいで一般化し、データが限られた状況でも変化するパターンに適応できるように、特化型時系列モデルの一般化の限界を克服する。
- 長期間予測において変動的複雑性を示すトランスフォーマー系モデルの問題を解決するため、Mambaアーキテクチャを採用して線形複雑性を実現する。
- 転移学習による事前学習済み Mamba 言語モデルの活用により、時系列基礎モデルのデータおよび計算コストを削減する。
- ファインチューニング段階で圧縮されたクロスチャネルアテンションモジュールを導入することで、効果的な多次元時系列予測を実現する。
- 最小限のファインチューニングデータで、最先端のモデルと同等またはそれ以上の強力なゼロショットおよびフルショット性能を示す。
提案手法
- 前方および後方の二重 Mamba エンコーダーを用いて、線形複雑性で時系列の長距離時系列依存関係をモデル化する。
- 2段階の転移学習戦略を採用:まず、パッチ単位の自己回帰的予測により Mamba バックボーンを事前学習し、次に予測ヘッドおよびその他のコンponentsをファインチューニングする。
- 事前学習済みの大規模言語モデル(LLM)である Mamba を活用して、時系列基礎モデルの初期化を実現し、大規模な時系列データセットへの依存度を低下させる。
- バックボーンでは各チャネルを独立して処理することで、異なるデータセットにおけるチャネル数の変動にも対応可能であり、同時にファインチューニング段階で圧縮されたクロスチャネルアテンションモジュールを導入してチャネル間関係をモデル化する。
- 2段階の訓練パイプラインを適用:第1段階では、マスキングされたパッチ予測に対して Mamba エンコーダーを最適化し、第2段階では予測ヘッドをファインチューニングし、エンコーダー特徴量を長期予測に適した形に精練する。
- スケーラビリティとデータセット間の適応性を高めるために、チャネルに依存しない Mamba バックボーンを採用し、チャネル間のモデリングはタスク固有のファインチューニング段階でのみ実施する。
実験結果
リサーチクエスチョン
- RQ1事前学習済みの Mamba 基盤モデルは、最小限の訓練データで多様な時系列データセットに対して競争力あるゼロショット予測性能を達成できるか?
- RQ2事前学習済み Mamba LLM を用いた2段階の転移学習アプローチは、時系列予測におけるデータ効率をどのように向上させるか?
- RQ3線形複雑性を持つ Mamba アーキテクチャは、2次的複雑性を示すトランスフォーマーと比較して、長期間予測においてどの程度優れた性能を示すか?
- RQ4提案された圧縮されたクロスチャネルアテンションモジュールは、多次元時系列のファインチューニング段階でチャネル間依存関係をどの程度効果的に捉えられるか?
- RQ5多様なデータで学習した基礎モデルは、大規模な再訓練を伴わず、未学習の時系列タスクや分野に一般化して効果的に機能するか?
主な発見
- TSMamba は、ETTm2、Weather、ILI といったベンチマークデータセットで、顕著に少ない訓練データで既存の基礎モデルを上回る最先端のゼロショット性能を達成した。
- フルショット設定では、TSMamba は複数の予測ホライズンで GPT4TS(Zhou et al., 2023)—GPT2に基づく基礎モデル—に対して平均15%の性能向上を達成した。
- TSMamba は、評価されたすべてのデータセットおよび予測ホライズンで、最先端のタスク特化型モデル PatchTST(Nie et al., 2023)を上回った。
- 単変量および多次元時系列(周波数やチャネル数が異なる)を含む多様なデータタイプにおいても、強力な性能を維持した。
- 2段階の転移学習プロセスにより、Mamba LLM からの有効な知識移転が実現され、大規模な時系列事前学習の必要性が顕著に低減された。
- 圧縮されたクロスチャネルアテンションモジュールは、バックボーンの複雑性を増加させることなく、ファインチューニング段階でチャネル間依存関係を効果的に捉えた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。