[논문 리뷰] Open-VCLIP: Transforming CLIP to an Open-vocabulary Video Model via Interpolated Weight Optimization
Open-VCLIP은 경량 시간 모델링을 통한 확장과 보간된 가중치 최적화를 사용하여 CLIP을 강력한 제로샷 비디오 분류기로 전환함으로써 CLIP의 일반화 능력을 유지하면서 비디오에 적응함. UCF-101에서 87.9%의 최고 수준의 제로샷 정확도, HMDB-51에서 58.3%, Kinetics-600에서 81.1%를 기록하여 이전 방법들에 비해 크게 앞서나감.
Contrastive Language-Image Pretraining (CLIP) has demonstrated impressive zero-shot learning abilities for image understanding, yet limited effort has been made to investigate CLIP for zero-shot video recognition. We introduce Open-VCLIP, a simple yet effective approach that transforms CLIP into a strong zero-shot video classifier that can recognize unseen actions and events at test time. Our framework extends CLIP with minimal modifications to model spatial-temporal relationships in videos, making it a specialized video classifier, while striving for generalization. We formally show that training an Open-VCLIP is equivalent to continual learning with zero historical data. To address this problem, we propose Interpolated Weight Optimization, which utilizes the benefit of weight interpolation in both training and test time. We evaluate our method on three popular and challenging action recognition datasets following various zero-shot evaluation protocols and we demonstrate our approach outperforms state-of-the-art methods by clear margins. In particular, we achieve 87.9%, 58.3%, 81.1% zero-shot accuracy on UCF, HMDB and Kinetics-600 respectively, outperforming state-of-the-art methods by 8.3%, 7.8% and 12.2%. Code is released at https://github.com/wengzejia1/Open-VCLIP.
연구 동기 및 목표
- 강력한 이미지 제로샷 모델인 CLIP을 원본의 개방형 어휘 일반화 능력을 잃지 않고 비디오 동작 인식에 적응시키는 도전 과제를 해결함.
- 제한된 데이터로 비디오 데이터셋에서 CLIP을 미세조정할 경우 발생하는 제로샷 성능 저하 문제를 해결함.
- 비디오 작업에 대한 특화와 CLIP의 제로샷 능력 유지 사이의 균형을 이루는 방법을 개발함.
- 원본 사전학습 데이터에 접근할 수 없음을 전제로 적응 과정을 연속 학습 문제로 공식화함.
- 카오스틱적 기억 상실을 방지하면서도 효과적인 비디오 이해를 가능하게 하는 정규화 전략을 제안함.
제안 방법
- 비디오의 공간-시간적 관계를 포착하기 위해 경량 시간 모델링 모듈을 추가하여 CLIP에 최소한의 수정을 가함.
- 모델이 원본 이미지-텍스트 데이터에 접근할 수 없는 조건에서 새로운 비디오 작업을 학습해야 하는 연속 학습 문제로 적응 과정을 공식화함.
- 보간된 가중치 최적화(IWO)를 도입하여, 가중치 변화에 대한 ℓ₂ 노름을 사용해 원래 CLIP 가중치에서의 이탈을 방지함으로써 정규화를 수행함.
- 학습 및 추론 중에 원래 CLIP 가중치와 업데이트된 가중치 사이의 보간을 적용하여 최적화 안정성 향상과 일반화 향상에 기여함.
- 원래 CLIP의 능력 유지와 비디오 특화 기능 적응 사이의 트레이드오프를 조절하기 위해 혼합 계수 λ를 사용함.
- CLIP의 텍스트 인코더를 유지하고 시각 타워 및 시간 모듈만 미세조정함으로써 CLIP의 텍스트 유도 분류 기반 제로샷 추론을 가능하게 함.
실험 결과
연구 질문
- RQ1원본 CLIP의 강력한 제로샷 일반화 능력을 유지하면서 비디오 동작 인식에 효과적으로 CLIP를 적응시킬 수 있는 방법은 무엇인가?
- RQ2원본 사전학습 데이터에 접근할 수 없는 조건에서 CLIP을 비디오 데이터에 대해 미세조정할 경우 카오스틱적 기억 상실을 방지할 수 있는 정규화 전략은 무엇인가?
- RQ3간단하고 파rameter 효율적인 CLIP 적응 방식이 표준 비디오 벤치마크에서 최고 성능의 제로샷 성능을 달성할 수 있는가?
- RQ4제안된 보간된 가중치 최적화(IWO)는 표준 ℓ₂ 정규화 및 기타 파rameter 효율적인 미세조정 방법에 비해 제로샷 및 클로즈드 세트 정확도 측면에서 어떻게 비교되는가?
- RQ5보간 기반 최적화 전략은 미사용 비디오 동작에 대한 학습 및 추론 모두에서 일반화를 향상시키는가?
주요 결과
- Open-VCLIP은 UCF-101에서 87.9%의 제로샷 정확도를 기록하여 이전 최고 성능보다 8.3%p 향상됨.
- Open-VCLIP은 HMDB-51에서 58.3%의 제로샷 정확도를 달성하여 이전 방법보다 7.8%p 향상됨.
- Open-VCLIP은 Kinetics-600에서 81.1%의 제로샷 정확도를 기록하여 이전 최고 성능 방법보다 12.2%p 높음.
- 모든 평가된 벤치마크에서 클로즈드 세트 및 제로샷 성능 간 최적의 트레이드오프를 달성하며, ST-Adapter 및 미세조정된 VCLIP과 같은 방법들을 모두 압도함.
- 텍스트-비디오 및 비디오-텍스트 검색 성능도 뛰어나 MSR-VTT에서 CLIP 대비 텍스트-비디오 검색 성능 2%p 향상되었고, 비디오-텍스트 검색에서는 CLIP를 크게 능가함.
- 보간된 가중치 최적화는 일반화를 지속적으로 향상시키며, 제거 실험을 통해 표준 ℓ₂ 정규화 및 파rameter 효율적인 미세조정 방법(예: ST-Adapter)보다 제로샷 인식에서 뛰어난 성능을 보임.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.