[논문 리뷰] S4ND: Modeling Images and Videos as Multidimensional Signals Using State Spaces
S4ND는 이미지와 영상을 이산 픽셀이 아닌 연속적인 다차원 신호로 간주하는 다차원 상태공간 모델을 제안한다. 이는 1D, 2D, 3D 데이터로 S4 프레임워크를 확장한 것으로, 주어진 분류 벤치마크에서 주로 어텐션 또는 컨볼루션 레이어를 S4ND로 대체함으로써 해상도에 영향을 받지 않는 전역적이고, 밴드리미티드 커널을 구현하며, 다양한 해상도 간 강력한 제로샷 일반화 성능을 달성한다.
Visual data such as images and videos are typically modeled as discretizations of inherently continuous, multidimensional signals. Existing continuous-signal models attempt to exploit this fact by modeling the underlying signals of visual (e.g., image) data directly. However, these models have not yet been able to achieve competitive performance on practical vision tasks such as large-scale image and video classification. Building on a recent line of work on deep state space models (SSMs), we propose S4ND, a new multidimensional SSM layer that extends the continuous-signal modeling ability of SSMs to multidimensional data including images and videos. We show that S4ND can model large-scale visual data in $1$D, $2$D, and $3$D as continuous multidimensional signals and demonstrates strong performance by simply swapping Conv2D and self-attention layers with S4ND layers in existing state-of-the-art models. On ImageNet-1k, S4ND exceeds the performance of a Vision Transformer baseline by $1.5\%$ when training with a $1$D sequence of patches, and matches ConvNeXt when modeling images in $2$D. For videos, S4ND improves on an inflated $3$D ConvNeXt in activity classification on HMDB-51 by $4\%$. S4ND implicitly learns global, continuous convolutional kernels that are resolution invariant by construction, providing an inductive bias that enables generalization across multiple resolutions. By developing a simple bandlimiting modification to S4 to overcome aliasing, S4ND achieves strong zero-shot (unseen at training time) resolution performance, outperforming a baseline Conv2D by $40\%$ on CIFAR-10 when trained on $8 imes 8$ and tested on $32 imes 32$ images. When trained with progressive resizing, S4ND comes within $\sim 1\%$ of a high-resolution model while training $22\%$ faster.
연구 동기 및 목표
- 이미지와 영상을 본질적으로 연속적이고 다차원적인 신호로 간주하는 연속 신호 모델링 방법을 개발하여, 이산 픽셀이 아닌 연속적인 시각 데이터 표현을 가능하게 한다.
- 1D 상태공간 모델(S4)의 성공을 2D 및 3D 시각 데이터로 확장하여 공간적 및 시간적 의존성에 대한 전역적이고 해상도에 영향을 받지 않는 모델링을 가능하게 한다.
- 학습된 커널의 고주파 성분을 마스킹하는 밴드리미트 막힘 메커니즘을 도입하여 해상도 간 일반화 시 발생하는 앨리어싱 아티팩트를 완화한다.
- 현대 시각 아키텍처의 컨볼루션 및 자기어텐션 레이어를 최소한의 학습 조정으로 효율적으로 교체할 수 있도록 한다.
- ImageNet-1k 및 HMDB-51과 같은 대규모 시각 벤치마크에서 제로샷 및 점진적 해상도 증가 설정 하에서 뛰어난 성능을 입증한다.
제안 방법
- S4ND는 각 공간 또는 시간 차원에 대해 독립적인 SSM을 적용하여 다차원 PDE를 구성하며, 이는 1D 상태공간 시스템의 텐서 곱으로 기술된다.
- 상태공간 행렬 C의 구조적 파arameterization을 사용하여 커널을 1D 커널의 저랭크 텐서 곱으로 분해함으로써, 효율적인 계산과 각 차원에 대한 독립적인 S4 연산으로의 해석을 가능하게 한다.
- S4의 파arameterization에서 유도된 연속 컨볼루션 커널을 사용하며, 커널은 A, B, Δ(스텝 크기)에 의해 제어되는 기저 함수(예: 푸리에 모드)의 선형 조합으로 구성된다.
- 커널 응답의 고주파 계수를 마스킹함으로써 밴드리미트 막힘 메커니즘을 도입하여 해상도 변화 시 부드러움을 확보하고 앨리어징을 방지한다.
- 전체 입력을 커버하는 전역적 맥락과 가중치 학습이 가능한 윈도우 크기를 통한 국소 인덕티브 바이어스를 모두 지원하여 장거리 및 국소 의존성에 대한 탄력적인 모델링이 가능하다.
- S4ND는 ViT 및 ConvNeXt 아키텍처에서 Conv2D 또는 자기어텐션 레이어의 즉각적인 교체로 구현되며, 아키텍처나 학습 절차에 최소한의 변경만을 요구한다.
실험 결과
연구 질문
- RQ1상태공간 모델 기반의 연속 신호 모델링 접근법이 대규모 이미지 및 영상 분류 벤치마크에서 경쟁적인 성능을 달성할 수 있는가?
- RQ2S4ND는 미세조정 없이도 새로운 해상도에 대해 어떻게 일반화되는가? 이러한 제로샷 해상도 일반화를 가능하게 하는 메커니즘은 무엇인가?
- RQ3밴드리미트 막힘의 영향은 시각 모델에서 커널의 부드러움과 해상도 간 성능에 어떤 영향을 미치는가?
- RQ4S4ND는 현대 시각 아키텍처에서 컨볼루션 및 어텐션 레이어를 효과적으로 대체할 수 있는가? 성능은 유지되거나 향상되는가?
- RQ5점진적 해상도 증가 학습은 S4ND의 성능 및 학습 속도를 고해상도 기준 모델과 비교해 어떻게 영향을 미치는가?
주요 결과
- ImageNet-1k에서 S4ND는 1D 패치 시퀀스를 사용할 경우 비전 트랜스포머보다 1.5% 높은 정확도를 달성하며, 2D 이미지 모델링에서는 ConvNeXt 성능을 재현한다.
- HMDB-51에서 영상 활동 분류 작업에서, 사전학습된 S4-2D-ConvNeXt 백본을 사용할 경우 S4ND는 팽창된 3D ConvNeXt 기준보다 성능을 4% 향상시킨다.
- 밴드리미트 막힘 기반으로, S4ND는 8×8에서 학습하고 32×32에서 테스트할 경우 CIFAR-10에서 Conv2D보다 40% 높은 제로샷 해상도 일반화 성능을 달성한다.
- 점진적 해상도 증가 학습을 통해 S4ND는 고해상도 모델의 성능에 약 1% 이내로 도달하면서도 표준 고해상도 기준 모델 대비 22% 더 빠른 학습 속도를 기록한다.
- S4ND의 암묵적인 연속 컨볼루션 커널은 구조적으로 해상도에 영향을 받지 않으며, 다양한 스케일 간 부드럽고 일반화된 특징 학습이 가능한 전역 맥락을 제공한다.
- 모델의 핵심 연산(FFT, 점곱, 역FFT)은 실행 시간의 65%를 차지하므로, 메모리 최적화된 병합 구현을 통해 상당한 속도 향상이 가능할 것으로 예상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.