[論文レビュー] S4ND: Modeling Images and Videos as Multidimensional Signals Using State Spaces
S4NDは、画像および動画を連続的で多次元的な信号として扱う多次元状態空間モデルを導入し、S4フレームワークを1次元、2次元、3次元データへと拡張する。S4NDは、自己注意または畳み込み層を置き換えることで、ImageNet-1kおよびHMDB-51で最先端の性能を達成し、解像度に依存しない、グローバルに受容可能な、帯域制限されたカーネルを実現し、解像度間で強力なゼロショット一般化を実現する。
Visual data such as images and videos are typically modeled as discretizations of inherently continuous, multidimensional signals. Existing continuous-signal models attempt to exploit this fact by modeling the underlying signals of visual (e.g., image) data directly. However, these models have not yet been able to achieve competitive performance on practical vision tasks such as large-scale image and video classification. Building on a recent line of work on deep state space models (SSMs), we propose S4ND, a new multidimensional SSM layer that extends the continuous-signal modeling ability of SSMs to multidimensional data including images and videos. We show that S4ND can model large-scale visual data in $1$D, $2$D, and $3$D as continuous multidimensional signals and demonstrates strong performance by simply swapping Conv2D and self-attention layers with S4ND layers in existing state-of-the-art models. On ImageNet-1k, S4ND exceeds the performance of a Vision Transformer baseline by $1.5\%$ when training with a $1$D sequence of patches, and matches ConvNeXt when modeling images in $2$D. For videos, S4ND improves on an inflated $3$D ConvNeXt in activity classification on HMDB-51 by $4\%$. S4ND implicitly learns global, continuous convolutional kernels that are resolution invariant by construction, providing an inductive bias that enables generalization across multiple resolutions. By developing a simple bandlimiting modification to S4 to overcome aliasing, S4ND achieves strong zero-shot (unseen at training time) resolution performance, outperforming a baseline Conv2D by $40\%$ on CIFAR-10 when trained on $8 imes 8$ and tested on $32 imes 32$ images. When trained with progressive resizing, S4ND comes within $\sim 1\%$ of a high-resolution model while training $22\%$ faster.
研究の動機と目的
- 画像および動画を離散的な画素ではなく、本質的に連続的で多次元的な信号として扱う、連続信号モデリングアプローチの開発。
- 1次元状態空間モデル(S4)の成功を2次元および3次元の視覚的データへと拡張し、空間的および時間的依存関係のグローバルかつ解像度に依存しないモデリングを可能にする。
- 解像度変更時のアリゼーションアーチファクトを克服するため、学習されたカーネル内の高周波成分をマスクする帯域制限機構を導入する。
- 現代の視覚アーキテクチャにおける畳み込み層および自己注意層の効率的かつ即座の置き換えを可能にし、最小限の学習手順の変更を実現する。
- ImageNet-1kおよびHMDB-51を含む大規模な視覚ベンチマークにおいて、ゼロショットおよびプログレッシブリサイズ設定下で強力な性能を示すことを実証する。
提案手法
- S4NDは、空間的または時間的各次元に沿って独立したS4モジュールを適用することで1次元SSMを拡張し、1次元状態空間系のテンソル積によって記述される多次元PDEを形成する。
- 状態空間行列Cの構造的パrameterizationを用いて、1次元カーネルの低ランクテンソル積への分解を実現し、各次元ごとの独立したS4操作としての効率的計算と解釈を可能にする。
- S4のパrameterizationから導かれる連続畳み込みカーネルを採用し、カーネルは行列A、B、Δ(ステップサイズ)によって制御される基底関数(例:フーリエモード)の線形結合として表現される。
- カーネル応答内の高周波係数をマスクすることで帯域制限機構を導入し、解像度変更時の滑らかさを保証し、アリゼーションを防止する。
- グローバルなコンテキスト(カーネルが入力全体をカバー)と局所的なインダクティブバイアス(学習可能なウィンドウサイズによる)を両立させ、長距離および局所的依存関係の柔軟なモデリングを可能にする。
- S4NDは、ViTおよびConvNeXtにおけるConv2Dまたは自己注意層の即座の置き換えとして導入可能であり、アーキテクチャ的・学習手順的変更を最小限に抑える。
実験結果
リサーチクエスチョン
- RQ1状態空間モデルに基づく連続信号モデリングアプローチが、大規模な画像および動画分類ベンチマークで競争力のある性能を達成できるか?
- RQ2S4NDは微調整なしに未観測の解像度にどのように一般化するのか?そのゼロショット解像度一般化を可能にするメカニズムは何か?
- RQ3帯域制限が視覚モデルにおけるカーネルの滑らかさおよび解像度間パフォーマンスに与える影響は何か?
- RQ4S4NDは、現代の視覚アーキテクチャにおける畳み込み層および注意層を効果的に置き換えられ、性能を維持または向上できるか?
- RQ5プログレッシブリサイズトレーニングは、高解像度ベースラインと比較してS4NDのパフォーマンスおよびトレーニング速度にどのような影響を与えるか?
主な発見
- ImageNet-1kでは、パッチの1次元シーケンスを用いる場合、S4NDはビジョントランスフォーマーを1.5%上回るトップ-1精度を達成し、2次元画像モデリングではConvNeXtと同等の性能を示す。
- HMDB-51における動画アクティビティ分類では、事前学習済みのS4-2D-ConvNeXtバックボーンを用いる場合、S4NDはインflated 3D ConvNeXtベースラインを4%上回る性能を達成する。
- 帯域制限を導入したS4NDは、8×8で学習し32×32でテストする場合、CIFAR-10でConv2Dを上回り、ゼロショット解像度一般化性能が40%高い。
- プログレッシブリサイズで学習した場合、S4NDは高解像度モデルの性能に約1%以内に達し、標準の高解像度ベースラインと比較して22%高速にトレーニングが可能である。
- S4NDの暗黙的な連続畳み込みカーネルは、構造的に解像度に依存せず、スケール間で滑らかで一般化された特徴学習とグローバルコンテキストを可能にする。
- モデルのコアな計算操作(FFT、ポイントワイド、逆FFT)は実行時間の65%を占めているため、メモリ最適化と統合された実装により、さらなる高速化が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。