[논문 리뷰] EZ-CLIP: Efficient Zeroshot Video Action Recognition
EZ-CLIP는 시간적 시각 프롬프트와 운동 인식 손실를 활용하여 계산적으로 효율적인 CLIP의 영상 행동 인식을 위한 적응 기법을 제안한다. 520만 개의 학습 가능한 파rameter만을 사용하여 단일 GPU에서 훈련되며, CLIP의 일반화 능력을 유지하면서도 다양한 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Recent advancements in large-scale pre-training of visual-language models on paired image-text data have demonstrated impressive generalization capabilities for zero-shot tasks. Building on this success, efforts have been made to adapt these image-based visual-language models, such as CLIP, for videos extending their zero-shot capabilities to the video domain. While these adaptations have shown promising results, they come at a significant computational cost and struggle with effectively modeling the crucial temporal aspects inherent to the video domain. In this study, we present EZ-CLIP, a simple and efficient adaptation of CLIP that addresses these challenges. EZ-CLIP leverages temporal visual prompting for seamless temporal adaptation, requiring no fundamental alterations to the core CLIP architecture while preserving its remarkable generalization abilities. Moreover, we introduce a novel learning objective that guides the temporal visual prompts to focus on capturing motion, thereby enhancing its learning capabilities from video data. We conducted extensive experiments on five different benchmark datasets, thoroughly evaluating EZ-CLIP for zero-shot learning and base-to-novel video action recognition, and also demonstrating its potential for few-shot generalization.Impressively, with a mere 5.2 million learnable parameters (as opposed to the 71.1 million in the prior best model), EZ-CLIP can be efficiently trained on a single GPU, outperforming existing approaches in several evaluations.
연구 동기 및 목표
- 기존 CLIP 적응 기법이 영상 행동 인식에 대해 높은 계산 비용을 유발하고 시간적 모델링 능력이 떨어지는 문제를 해결한다.
- 백본을 미세조정하지 않고도 CLIP의 강력한 제로샷 일반화 능력을 유지하면서 효과적인 시공간 표현 학습을 가능하게 한다.
- 이미지 기반의 시각-언어 모델을 영상 작업에 적응시키기 위해 경량이며 파rameter 효율적인 방법을 개발한다.
- 새로운 운동 제약 손실를 통해 영상 내 운동 신호를 보다 효과적으로 모델링한다.
- 다양한 데이터셋에서 제로샷, 베이스-노버브, 소수의 샘플을 활용한 영상 행동 인식에서 뛰어난 성능을 입증한다.
제안 방법
- CLIP의 입력 공간에 통합되는 학습 가능한 임bed딩인 시간적 시각 프롬프트를 도입하여 영상 프레임 간의 시간적 의존성을 모델링한다.
- 추론 시 프레임 수준의 특징을 고려해 프롬프트를 활용하여 최소한의 파rameter로 시간적 동역학을 엔드 투 엔드로 학습한다.
- 특징 맵을 프레임 간 비교하여 운동 관련 영역에 주목하도록 유도하는 운동 손실을 제안한다.
- 영상과 텍스트 임베딩 간의 대비 학습 목표를 사용하며, 프롬프트가 원본 CLIP 백본을 업데이트하지 않고 시간적 주의를 유도한다.
- 원본 CLIP 비전 및 텍스트 인코더를 동결한 채로, 오직 시간적 시각 프롬프트와 운동 손실만을 통해 엔드 투 엔드로 모델을 훈련한다.
- 제로샷 설정에서 텍스트 임베딩의 일반화 능력을 향상시키기 위해 LLM이 생성한 행동 기술을 텍스트 프롬프트로 활용한다.
실험 결과
연구 질문
- RQ1백본을 미세조정하지 않고도 최소한의 파rameter로 CLIP의 경량적이고 파rameter 효율적인 적응이 영상 행동 인식에서 강력한 제로샷 성능을 달성할 수 있는가?
- RQ2최소한의 학습 가능한 파rameter로 시간적 시각 프롬프트가 영상에서 장거리 시간적 의존성을 얼마나 효과적으로 모델링할 수 있는가?
- RQ3표준 대비 학습 기반의 손실 대비, 운동 인식 손실이 영상 내 운동 신호를 포착하는 데 얼마나 효과적인가?
- RQ4특히 Something-Something-v2와 같이 운동 중심의 데이터셋에서 EZ-CLIP는 베이스-노버브 행동 인식에서 얼마나 잘 일반화되는가?
- RQ5기존의 CLIP 기반 영상 적응 기법을 능가하면서도 고처리량과 낮은 FLOPs를 유지할 수 있는가?
주요 결과
- EZ-CLIP는 단지 520만 개의 조정 가능한 파arameter만으로 UCF-101(95.9% top-1), HMDB-51(79.8% top-1), Something-Something-v2(54.0% top-1)에서 최신 기술 수준의 제로샷 정확도를 달성한다.
- 도전적인 SSv2 데이터셋에서 EZ-CLIP는 54.0%의 top-1 정확도를 기록하며, 더 적은 파arameter와 더 높은 처리량을 바탕으로 기존 방법들을 크게 능가한다.
- 단일 A100 GPU에서 322.4 throughput (TP)을 기록하여 ViFi-CLIP(71.1 TP) 및 ActionCLIP(67.7 TP)와 비교해 효율성이 뛰어나다.
- 운동 손실는 주의 분포를 운동 영역으로 향하게 하며, 시각화 결과 EZ-CLIP는 움직이는 물체에 주목하는 반면 기존 CLIP 모델은 배경과 외관에 주목하는 것으로 확인된다.
- LLM가 생성한 행동 기술은 텍스트 임베딩의 일반화 능력을 향상시키며, 제로샷 설정에서 HMDB-51에서 최대 2.5% 향상되고 UCF-101에서는 11% 향상된다.
- t-SNE 시각화 결과 EZ-CLIP는 특히 '무언가를 표면에 올리는' 등의 운동에 의존하는 행동에서 기존 모델보다 더 잘 분리된 특징 표현을 학습하는 것으로 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.