[논문 리뷰] Expanding Language-Image Pretrained Models for General Video Recognition
이 논문은 CLIP 및 Florence와 같은 사전 훈련된 언어-이미지 모델을 일반 영상 인식에 적응시키기 위해, 시간적 모델링을 위한 경량 크로스프레임 어텐션 메커니즘과 학습 가능한 영상 전용 프롬프팅 기법을 도입한 X-CLIP를 제안한다. 이 방법은 ViViT-H 대비 12배 적은 FLOPs를 사용하면서도, 제로샷(+14.9% top-1 정확도 향상), 희소샷(+32.1% 향상), 그리고 완전히 지도 학습(킨etics-400에서 87.1% top-1 정확도) 설정에서 최신 기술 수준의 성능을 달성한다.
Contrastive language-image pretraining has shown great success in learning visual-textual joint representation from web-scale data, demonstrating remarkable "zero-shot" generalization ability for various image tasks. However, how to effectively expand such new language-image pretraining methods to video domains is still an open problem. In this work, we present a simple yet effective approach that adapts the pretrained language-image models to video recognition directly, instead of pretraining a new model from scratch. More concretely, to capture the long-range dependencies of frames along the temporal dimension, we propose a cross-frame attention mechanism that explicitly exchanges information across frames. Such module is lightweight and can be plugged into pretrained language-image models seamlessly. Moreover, we propose a video-specific prompting scheme, which leverages video content information for generating discriminative textual prompts. Extensive experiments demonstrate that our approach is effective and can be generalized to different video recognition scenarios. In particular, under fully-supervised settings, our approach achieves a top-1 accuracy of 87.1% on Kinectics-400, while using 12 times fewer FLOPs compared with Swin-L and ViViT-H. In zero-shot experiments, our approach surpasses the current state-of-the-art methods by +7.6% and +14.9% in terms of top-1 accuracy under two popular protocols. In few-shot scenarios, our approach outperforms previous best methods by +32.1% and +23.1% when the labeled data is extremely limited. Code and models are available at https://aka.ms/X-CLIP
연구 동기 및 목표
- 사전 훈련된 언어-이미지 모델을 다시 훈련하지 않고 영상 인식에 적응시키기.
- 경량형 플러그인 모듈을 사용해 영상 프레임 간 장거리 시간적 의존성을 효율적으로 모델링하는 문제 해결.
- 영상 콘텐츠 정보를 통합해 더 구분력 있는 텍스트 프롬프트를 생성함으로써 제로샷 및 희소샷 일반화 성능 향상.
- 다양한 영상 인식 시나리오(제로샷, 희소샷, 완전히 지도 학습)로의 효과적인 전이 지원.
제안 방법
- 메시지 토큰을 사용해 프레임 간 명시적인 정보 교환을 가능하게 하면서도 프레임 수준 표현을 유지하는 크로스프레임 커뮤니케이션 트랜스포머 도입.
- 프레임 수준 특징을 통합된 영상 수준 표현으로 통합하기 위해 다중 프레임 통합 트랜스포머 활용.
- 세분화된 레이블과 영상 콘텐츠 특징을 조합해 적응형이고 구분력 있는 텍스트 프롬프트를 생성하는 학습 가능한 영상 전용 프롬프팅 기법 제안.
- 훈련 및 추론 시 희소 샘플링 전략을 적용하여 밀집 샘플링보다 우수한 성능을 보이며, 다양한 뷰 수에 걸쳐도 강건성을 유지.
- 다중 뷰 추론을 적용해 제로샷 및 희소샷 설정에서 성능을 향상시키며, 사전 훈련된 언어-이미지 인코더의 강건성을 활용.
- 이미지 및 텍스트 인코더의 엔드 투 엔드 미세조정을 지원하며, 아블레이션 연구를 통해 제로샷 및 완전히 지도 학습 설정에서 둘 다 미세조정했을 때 최적의 성능를 얻는 것으로 확인.
실험 결과
연구 질문
- RQ1사전 훈련된 언어-이미지 모델을 전체 재훈련 없이 영상 인식에 효과적으로 적응시킬 수 있는가?
- RQ2경량형 플러그인 모듈을 사용해 영상 프레임 간 시간적 의존성을 효율적으로 모델링할 수 있는가?
- RQ3영상 콘텐츠 인식 프롬프팅이 제로샷 및 희소샷 영상 인식에서 텍스트 표현의 구분력을 향상시킬 수 있는가?
- RQ4이 프레임워크에서 훈련 및 추론에 최적의 샘플링 전략(밀집 대 희소)은 무엇인가?
- RQ5다른 미세조정 전략(이미지 인코더만 고정 vs. 텍스트 인코더만 고정)은 제로샷, 희소샷, 완전히 지도 학습 설정에서 성능에 어떤 영향을 미치는가?
주요 결과
- X-CLIP는 완전히 지도 학습 설정에서 킨etics-400에서 87.1%의 top-1 정확도를 달성하며, ViViT-H보다 2.3% 높은 성능을 보였고, FLOPs는 12배 적게 사용.
- 제로샷 평가에서 X-Florence는 표준 프rotocol 두 가지 모두에서 ActionCLIP보다 각각 +7.6%와 +14.9% 높은 성능 기록.
- 매우 제한된 레이블 데이터가 있는 희소샷 학습에서 X-CLIP는 이전 최고 성능 방법보다 각각 +32.1%와 +23.1% 높은 정확도 확보.
- 제안된 영상 전용 프롬프팅 기법은 CLIP-Mean 기준 +2.3% 향상으로, 구분력 있는 텍스트 프롬프트 생성의 효과성을 입증.
- 훈련 및 추론 시 희소 샘플링이 밀집 샘플링보다 항상 더 우수한 성능 보이며, 단일 뷰 추론이 10뷰 추론과 유사한 성능 기록함으로써 강건한 표현의 효과를 입증.
- 제로샷 설정에서는 이미지 및 텍스트 인코더를 모두 미세조정할 때 최고의 성능를 기록하며, 희소샷 설정에서는 텍스트 인코더만 미세조정했을 때 최고의 성능 기록함으로써, 제한된 데이터에서 텍스트 인코더의 과적합 위험 감소를 시사.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.