[논문 리뷰] Temporally-Adaptive Models for Efficient Video Understanding
이 논문은 시간에 따라 적응하는 컨볼루션(TAdaConv)을 제안한다. TAdaConv는 지역적이고 전반적인 시간적 맥락을 사용해 각 프레임마다 커널 가중치를 적응적으로 校정함으로써 공간 컨볼루션에 동적 시간 모델링을 통합하는 플러그인 모듈이다. TAdaConv는 효율성과 성능을 향상시켜 TAdaConvNeXtV2와 TAdaFormer 등의 모델이 계산량을 줄이고 강력한 일반화 능력을 유지하면서도 행동 인식 및 국소화 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있도록 한다.
Spatial convolutions are extensively used in numerous deep video models. It fundamentally assumes spatio-temporal invariance, i.e., using shared weights for every location in different frames. This work presents Temporally-Adaptive Convolutions (TAdaConv) for video understanding, which shows that adaptive weight calibration along the temporal dimension is an efficient way to facilitate modeling complex temporal dynamics in videos. Specifically, TAdaConv empowers spatial convolutions with temporal modeling abilities by calibrating the convolution weights for each frame according to its local and global temporal context. Compared to existing operations for temporal modeling, TAdaConv is more efficient as it operates over the convolution kernels instead of the features, whose dimension is an order of magnitude smaller than the spatial resolutions. Further, kernel calibration brings an increased model capacity. Based on this readily plug-in operation TAdaConv as well as its extension, i.e., TAdaConvV2, we construct TAdaBlocks to empower ConvNeXt and Vision Transformer to have strong temporal modeling capabilities. Empirical results show TAdaConvNeXtV2 and TAdaFormer perform competitively against state-of-the-art convolutional and Transformer-based models in various video understanding benchmarks. Our codes and models are released at: https://github.com/alibaba-mmai-research/TAdaConv.
연구 동기 및 목표
- 비디오 이해에서 표준 공간 컨볼루션의 비효율성과 제한된 시간 모델링 능력을 해결하기 위해.
- 사전 훈련된 가중치를 손상시키지 않으면서도 높은 계산 비용 없이 동적이고 프레임별 커널 적응을 가능하게 하기 위해.
- 커널 校정에 지역적이고 전반적인 시간적 맥락을 통합하여 컨볼루션 기반 및 Transformer 기반 비디오 모델의 시간 모델링을 향상시키기 위해.
- 효율성과 확장성을 유지하면서 최신 기술 수준의 모델과 경쟁 가능한 성능을 달성하기 위해.
- 대규모 사전 훈련과 사후 훈련을 통해 강력한 제로샷 및 소수 샘플 일반화 능력을 입증하기 위해.
제안 방법
- TAdaConv는 각 프레임에 대해 컨볼루션 커널을 $\mathbf{W}_t = \bm{\alpha}_t \cdot \mathbf{W}_b$로 인수분해하며, 여기서 $\mathbf{W}_b$는 학습 가능한 기본 가중치이고 $\bm{\alpha}_t$는 시간적 校정 가중치이다.
- 교정 가중치 $\bm{\alpha}_t$는 인접 프레임의 프레임 기술자와 전반적인 비디오 기술자를 사용하여 다중 헤드 자기주의를 통해 장거리 시간 의존성을 포착함으로써 생성된다.
- TAdaBlocks는 ConvNeXt와 비전 트랜스포머 아키텍처 양쪽에 모두 효율적인 시간 특징 집합을 통합하는 TAdaConv를 통합한 향상된 빌딩 블록으로 도입된다.
- TAdaConvV2는 교정 메커니즘을 최적화하고 더 효과적인 주의 기반 전역 맥락 인코더를 도입하여 원래 TAdaConv를 향상시킨다.
- TAdaConvNeXtV2와 TAdaFormer는 이미지넷 사전 훈련을 거친 후 Kinetics-710에서 사후 훈련을 추가로 수행하여 제로샷 및 소수 샘플 성능을 향상시켰다.
- 이 방법은 드롭인 대체 방식으로 설계되어 사전 훈련된 가중치를 유지하면서도 재학습 없이도 비디오 작업에 효율적으로 적응할 수 있도록 한다.
실험 결과
연구 질문
- RQ1고정된 가중치 컨볼루션과 비교해 시간 차원에 따라 적응적인 커널 교정이 비디오 이해의 효율성과 정확도를 향상시키는가?
- RQ2커널 수준의 적응 메커니즘이 사전 훈련된 가중치를 유지하면서도 비디오 모델의 강력한 시간 모델링을 가능하게 하는가?
- RQ3계산 비용과 성능 측면에서 TAdaConv는 표준 1D 시간 컨볼루션과 다른 동적 필터링 방법과 어떻게 비교되는가?
- RQ4TAdaConv는 행동 인식 및 국소화 작업에서 컨볼루션 기반 및 트랜스포머 기반 비디오 모델 모두를 얼마나 향상시키는가?
- RQ5대규모 사전 훈련과 사후 훈련이 TAda 기반 모델의 제로샷 일반화 능력을 추가로 향상시키는가?
주요 결과
- 32프레임을 사용하는 TAdaConvNeXtV2-S는 계산량의 57%만으로 Kinetics-400에서 Swin-B보다 1.3% 높은 성능을 기록하여 높은 효율성과 정확도를 입증했다.
- TAdaConvNeXt-B는 유사한 사전 훈련 조건 하에서 Something-Something-V1과 V2에서 각각 TDN-R101보다 3.9%와 2.9% 높은 정확도를 기록했다.
- TAdaFormer-L/14는 SSV1과 SSV2에서 각각 UniFormerV2-L/14보다 0.8%와 0.5% 높은 성능을 기록하여 시간 모델링 작업에서 강력한 성능을 보였다.
- TAdaFormer-B/16는 피지드 클립 ViFi-CLIP보다 UCF101과 HMDB51에서 더 높은 제로샷 정확도를 기록했으며, 모델 스케일링과 사후 훈련을 통해 추가 성능 향상을 이뤘다.
- HACS와 Epic-Kitchens-100에서 TAdaConvNeXtV2와 TAdaFormer는 행동 국소화를 위한 강력한 특징을 생성했으며, BMN 기반 모델을 초월하고 ViViT 및 SlowFast 수준의 경쟁력 있는 성능을 달성했다.
- TAdaConvNeXtV2와 TAdaFormer는 모델 크기의 증가와 대규모 사전 훈련(특히 Kinetics-710에서의 사후 훈련 포함)에 따라 강력한 확장성을 보였으며 성능 향상이 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.