[논문 리뷰] Depthwise Spatio-Temporal STFT Convolutional Neural Networks for Human Action Recognition
이 논문은 인간 행동 인식을 위한 3D CNN에서 3D 합성곱 층의 파rameter 효율적인 대안으로 공간-시간 단기 푸리에 변환(STFT) 블록을 제안한다. 공간과 시간에서 국소적인 푸리에 특징을 추출하기 위해 훈련 불가능한 STFT 커널을 사용한 후, 채널 간 상관관계를 위해 훈련 가능한 선형 가중치를 적용함으로써, 파rameter 수를 3.5–4.5배 감소시키고 계산량을 1.5–1.8배 감소시키면서도 Kinetics-400 및 Jester를 포함한 일곱 가지 벤치마크에서 최신 기준 또는 그 이상의 정확도를 달성한다.
Conventional 3D convolutional neural networks (CNNs) are computationally expensive, memory intensive, prone to overfitting, and most importantly, there is a need to improve their feature learning capabilities. To address these issues, we propose spatio-temporal short term Fourier transform (STFT) blocks, a new class of convolutional blocks that can serve as an alternative to the 3D convolutional layer and its variants in 3D CNNs. An STFT block consists of non-trainable convolution layers that capture spatially and/or temporally local Fourier information using a STFT kernel at multiple low frequency points, followed by a set of trainable linear weights for learning channel correlations. The STFT blocks significantly reduce the space-time complexity in 3D CNNs. In general, they use 3.5 to 4.5 times less parameters and 1.5 to 1.8 times less computational costs when compared to the state-of-the-art methods. Furthermore, their feature learning capabilities are significantly better than the conventional 3D convolutional layer and its variants. Our extensive evaluation on seven action recognition datasets, including Something-something v1 and v2, Jester, Diving-48, Kinetics-400, UCF 101, and HMDB 51, demonstrate that STFT blocks based 3D CNNs achieve on par or even better performance compared to the state-of-the-art methods.
연구 동기 및 목표
- 비디오 행동 인식을 위한 3D CNN에서 높은 계산 비용, 메모리 사용량 및 과적합 문제를 해결하기 위해.
- 기존의 3D 합성곱을 새로운 STFT 기반 블록 아키텍처로 대체하여 3D CNN의 특징 학습 능력을 향상시키기 위해.
- 다양한 행동 인식 데이터셋에서 최신 기준 성능을 유지하거나 초월하는 파rameter 및 계산량 효율적인 아키텍처를 설계하기 위해.
- 비디오 모델링에서 다양한 공간-시간 차원에서 STFT 기반 특징 추출의 효과성을 탐색하기 위해.
제안 방법
- ST-STFT(3D STFT), S-STFT(2D 공간 STFT + 깊이wise 시간), T-STFT(깊이wise 공간 + 1D 시간 STFT)의 세 가지 변종 STFT 블록을 제안한다.
- 공간-시간 볼륨 내 다수의 저주파수 지점에서 국소적인 푸리에 계수를 추출하기 위해 훈련 불가능한 STFT 커널을 사용한다.
- STFT 출력을 처리하기 위해 깊이wise 3D 합성곱을 적용하여 공간 및 시간 차원에서 효율적인 계산을 가능하게 한다.
- STFT 레이어 이후에 훈련 가능한 선형 가중치를 도입하여 채널 간 상관관계를 모델링하고 특징 표현을 향상시킨다.
- 표준 3D 합성곱을 대체하기 위해 레이저넷 기반 네트워크의 버티컬 블록 아키텍처 내부에 STFT 블록을 통합한다.
- ImageNet 사전 훈련에 의존하지 않고 Kinetics-400와 같은 대규모 데이터셋에서부터 모델을 처음부터 훈련하여 일반화 능력을 평가한다.
실험 결과
연구 질문
- RQ1STFT 기반 블록은 성능을 저하시키지 않고 3D CNN의 파라미터 수와 FLOPs를 줄일 수 있는가?
- RQ2STFT 블록은 기존의 3D 합성곱 및 분해된 변종(R(2+1)D, S3D 등)과 비교해 공간-시간 특징을 어떻게 학습하는가?
- RQ3훈련 불가능한 STFT 커널의 사용이 학습 가능한 3D 합성곱보다 특징 표현을 향상시키는가?
- RQ4Jester, Kinetics-400, UCF-101와 같은 다양한 복잡도와 크기의 데이터셋에서 STFT 기반 모델의 성능 스케일링 능력은 어떠한가?
- RQ5Kinetics와 같은 대규모 데이터셋에서 사전 훈련한 STFT 기반 모델은 소규모 데이터셋에서도 잘 일반화되는가?
주요 결과
- T-STFT 변종은 Jester 데이터셋에서 96.94%의 정확도를 달성하여 SOTA STM 모델보다 0.24% 높은 성능을 보였으며, FLOPs는 1.6배 적고 파라미터 수는 4.1배 적었다.
- Kinetics-400에서 T-STFT 모델은 61.1%의 top-1 정확도를 기록하여 파라미터 수가 5.2배 적은 R(2+1)D-ResNet18 기준선(56.8%)을 초월했다.
- ST-STFT 블록은 Kinetics-400에서 39.4%의 top-1 정확도를 기록하여 최소한의 파라미터로도 뛰어난 성능를 보였다.
- UCF-101 및 HMDB-51에서 Kinetics 사전 훈련된 STFT 모델은 각각 94.7% 및 71.5%의 정확도를 기록하여 ImageNet+Kinetics 사전 훈련된 SOTA 모델과 유사한 성능를 보였다.
- 매우 낮은 파라미터 수(최신 기준 대비 3–5배 감소) 덕분에 과적합에 대한 저항력이 향상되어, 처음부터 훈련한 경우에도 안정적인 성능을 보였다.
- Jester와 같은 시간적으로 도전적인 데이터셋과 Kinetics-400와 같은 대규모 시나리오 데이터셋을 포함한 다양한 데이터셋에서 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.