[论文解读] S4ND: Modeling Images and Videos as Multidimensional Signals Using State Spaces
S4ND 引入了一种多维状态空间模型,将图像和视频视为连续的多维信号,将 S4 框架扩展至一维、二维和三维数据。通过用 S4ND 替换注意力或卷积层,其在 ImageNet-1k 和 HMDB-51 上实现了最先进性能,实现了分辨率无关的全局感受野、带限核,并在不同分辨率间展现出强大的零样本泛化能力。
Visual data such as images and videos are typically modeled as discretizations of inherently continuous, multidimensional signals. Existing continuous-signal models attempt to exploit this fact by modeling the underlying signals of visual (e.g., image) data directly. However, these models have not yet been able to achieve competitive performance on practical vision tasks such as large-scale image and video classification. Building on a recent line of work on deep state space models (SSMs), we propose S4ND, a new multidimensional SSM layer that extends the continuous-signal modeling ability of SSMs to multidimensional data including images and videos. We show that S4ND can model large-scale visual data in $1$D, $2$D, and $3$D as continuous multidimensional signals and demonstrates strong performance by simply swapping Conv2D and self-attention layers with S4ND layers in existing state-of-the-art models. On ImageNet-1k, S4ND exceeds the performance of a Vision Transformer baseline by $1.5\%$ when training with a $1$D sequence of patches, and matches ConvNeXt when modeling images in $2$D. For videos, S4ND improves on an inflated $3$D ConvNeXt in activity classification on HMDB-51 by $4\%$. S4ND implicitly learns global, continuous convolutional kernels that are resolution invariant by construction, providing an inductive bias that enables generalization across multiple resolutions. By developing a simple bandlimiting modification to S4 to overcome aliasing, S4ND achieves strong zero-shot (unseen at training time) resolution performance, outperforming a baseline Conv2D by $40\%$ on CIFAR-10 when trained on $8 imes 8$ and tested on $32 imes 32$ images. When trained with progressive resizing, S4ND comes within $\sim 1\%$ of a high-resolution model while training $22\%$ faster.
研究动机与目标
- 开发一种面向视觉数据的连续信号建模方法,将图像和视频视为本质上连续的多维信号,而非离散像素。
- 将一维状态空间模型(S4)的成功扩展至二维和三维视觉数据,实现空间与时间依赖关系的全局、分辨率无关建模。
- 通过引入带限机制,掩蔽所学核中的高频分量,克服跨分辨率泛化中的混叠伪影。
- 实现对现代视觉架构中卷积层和自注意力层的高效、即插即用式替换,仅需极少的训练改动。
- 在大规模视觉基准测试(包括 ImageNet-1k 和 HMDB-51)中展示优异性能,涵盖零样本和渐进式缩放设置。
提出的方法
- S4ND 通过在每个空间或时间维度上独立应用 SSM,将一维 SSM 扩展至多维,形成由一维状态空间系统张量积所决定的多维偏微分方程(PDE)。
- 采用状态空间矩阵 C 的结构化参数化,将核分解为一维核的低秩张量积,实现高效计算,并可解释为每个维度上的独立 S4 操作。
- 采用源自 S4 参数化的连续卷积核,其中核为基函数(如傅里叶模态)的线性组合,由矩阵 A、B 和 Δ(步长)控制。
- 通过掩蔽核响应中的高频系数,引入带限机制,确保平滑性,并在分辨率变化时防止混叠。
- 模型支持全局上下文(核覆盖完整输入)和局部归纳偏置(通过可学习的感受野大小实现),灵活建模长程与局部依赖关系。
- S4ND 可作为 ViT 和 ConvNeXt 中 Conv2D 或自注意力层的即插即用替代品,仅需极少的架构或训练流程改动。
实验结果
研究问题
- RQ1基于状态空间模型的连续信号建模方法是否能在大规模图像与视频分类基准上实现具有竞争力的性能?
- RQ2S4ND 在未微调的情况下如何泛化至未见过的分辨率?其零样本分辨率泛化能力由何种机制支持?
- RQ3带限机制对视觉模型中核的平滑性及跨分辨率性能有何影响?
- RQ4S4ND 是否能有效替代现代视觉架构中的卷积层与注意力层,同时保持或提升性能?
- RQ5与高分辨率基线相比,渐进式缩放训练对 S4ND 的性能与训练速度有何影响?
主要发现
- 在 ImageNet-1k 上,当使用一维补丁序列时,S4ND 的 Top-1 准确率比 Vision Transformer 高 1.5%;在二维图像建模中,其性能与 ConvNeXt 相当。
- 在 HMDB-51 视频动作分类任务中,使用预训练的 S4-2D-ConvNeXt 主干网络时,S4ND 相较于膨胀的 3D ConvNeXt 基线性能提升 4%。
- 通过带限机制,S4ND 在 CIFAR-10 上实现 40% 更高的零样本分辨率泛化能力(训练于 8×8,测试于 32×32 图像),优于 Conv2D。
- 在渐进式缩放训练下,S4ND 的性能与高分辨率模型相差约 1%,同时训练速度比标准高分辨率基线快 22%。
- S4ND 的隐式连续卷积核从构造上即具备分辨率无关性,支持全局上下文与跨尺度平滑、泛化的特征学习。
- 模型核心计算操作(FFT、逐点计算、逆 FFT)占运行时间的 65%,表明通过内存优化的融合实现可显著提升速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。