Skip to main content
QUICK REVIEW

[論文レビュー] Liquid Structural State-Space Models

Ramin Hasani, Mathias Lechner|arXiv (Cornell University)|Sep 26, 2022
Neural Networks and Applications被引用数 13
ひとこと要約

この論文は、液体時定数(LTC)ネットワークの入力適応型ダイナミクスと、S4の効率的で構造化されたパrameterizationを統合した、新しい状態空間モデルであるLiquid-S4を紹介する。S4の固定された状態遷移行列を、入力に依存するものに置き換えることで、入力に特化した時間的ダイナミクスを学習し、長距離シーケンスタスクにおいて、S4と比較して30%少ないパラメータで、Long-Range Arenaベンチマークで平均87.32%の精度を達成する。

ABSTRACT

A proper parametrization of state transition matrices of linear state-space models (SSMs) followed by standard nonlinearities enables them to efficiently learn representations from sequential data, establishing the state-of-the-art on a large series of long-range sequence modeling benchmarks. In this paper, we show that we can improve further when the structural SSM such as S4 is given by a linear liquid time-constant (LTC) state-space model. LTC neural networks are causal continuous-time neural networks with an input-dependent state transition module, which makes them learn to adapt to incoming inputs at inference. We show that by using a diagonal plus low-rank decomposition of the state transition matrix introduced in S4, and a few simplifications, the LTC-based structural state-space model, dubbed Liquid-S4, achieves the new state-of-the-art generalization across sequence modeling tasks with long-term dependencies such as image, text, audio, and medical time-series, with an average performance of 87.32% on the Long-Range Arena benchmark. On the full raw Speech Command recognition, dataset Liquid-S4 achieves 96.78% accuracy with a 30% reduction in parameter counts compared to S4. The additional gain in performance is the direct result of the Liquid-S4's kernel structure that takes into account the similarities of the input sequence samples during training and inference.

研究の動機と目的

  • 長距離時系列データ向けに、構造的状態空間モデル(SSMs)の一般化能力および因果的推論能力を向上させること。
  • LTCのような連続時間ニューラルネットワークのスケーラビリティおよび表現力の限界を、S4の効率的なカーネル計算と統合することで解決すること。
  • 推論中に入力シーケンスに応じて動的に適応する線形状態空間モデルを構築し、テキスト、音声、画像、時系列データを含む多様なモodalitiesで性能を向上させること。
  • S4や他のSOTAモデルと比較して、パラメータ数を削減しつつ、複数のベンチマークでSOTAの性能を達成すること。

提案手法

  • 入力に依存する状態遷移ダイナミクスを持つ線形化された液体時定数(LTC)状態空間モデルを提案:$\dot{x} = (\mathbf{A} + \mathbf{B}u)x + \mathbf{B}u$、ここで$u$は入力である。
  • S4フレームワークを応用し、状態遷移行列に対角行列+低ランク分解を適用することで、周波数ドメインのカーネル変換により効率的な計算を実現する。
  • 時間ラグにわたる入力信号の類似性を考慮する新しい畳み込みカーネルを導入し、標準的なS4を上回る表現学習を強化する。
  • ヒッポ(HiPPO)プロジェクション機構を用いて、歴史的な信号コンテンツを記憶し、長距離依存性を保持する。
  • 逆フーリエ変換を用いて、時間ドメインでのカーネル計算を効率的に行い、計算効率を維持する。
  • S4-LegSと同一のパrameterizationを活用することで、直接的な比較と既存のS4実装への統合を可能にする。

実験結果

リサーチクエスチョン

  • RQ1液体時定数ネットワークの入力適応型状態遷移ダイナミクスを、構造化された状態空間モデルに効果的に統合することで、長距離シーケンスにおける一般化性能が向上するか?
  • RQ2時間ラグにわたる信号類似性を捉える入力依存カーネル項を含めることで、多様なシーケンスモデリングタスクにおける性能向上が達成されるか?
  • RQ3線形化されたLTC定式化は、S4の効率性とスケーラビリティを維持しつつ、複数のベンチマークでそれを上回る性能を発揮できるか?
  • RQ4画像分類、音声認識、医療時系列データなどの長距離シーケンスタスクにおいて、Liquid-S4の性能はS4、Transformer、RNN、CNNと比較してどの程度優れているか?
  • RQ5Liquid-S4のパラメータ数の削減は、精度を損なうことなく、性能向上にどの程度寄与しているか?

主な発見

  • Liquid-S4は、Long-Range Arenaベンチマークの全6タスクで、平均87.32%の新しいSOTA精度を達成した。
  • 完全な原始音声コマンドデータセット(Speech Command)では、S4と比較して30%のパラメータ削減で96.78%の精度を達成した。
  • BIDMCバイタルサインデータセットでは、心拍数でS4-LegSを8.7%、呼吸数で36%、血中酸素飽和度予測で26.67%上回った。
  • 次数$p=3$の液体カーネルを搭載したLiquid-S4は、1次元ピクセルレベルの画像分類で、S4およびTransformerベースラインを上回る優れた性能を発揮した。
  • 16kHz音声コマンドデータセットではゼロショット一般化性能が強く、96.78%の精度を達成し、SC10リダクドサブセットでも98.51%のSOTA性能を維持した。
  • リストオプスやIMDBなどのタスクでは、7ユニットという非常に小さなカーネルサイズ(例:7)で十分な性能が得られ、パラメータ数を顕著に削減しながら、精度を維持または向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。