[논문 리뷰] Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models
이 논문은 사전 훈련된 시각-언어 모델(VLM)을 확장하여 영상, 광학 흐름, 음성 스펙트로그램을 동시에 처리할 수 있도록 하는 다중모달 오픈보이드 비디오 분류 방법 MOV를 제안한다. 이러한 모달 간의 교차어텐션 융합을 통해 MOV는 Kinetics-700, VGGSound, UCF, HMDB 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 기초 클래스와 신규 클래스 양쪽 모두에서 정확도를 크게 향상시킨다. 특히 기존 VLM 기반 모델 대비 신규 클래스 성능을 최대 3.5% 향상시킨다.
Utilizing vision and language models (VLMs) pre-trained on large-scale image-text pairs is becoming a promising paradigm for open-vocabulary visual recognition. In this work, we extend this paradigm by leveraging motion and audio that naturally exist in video. We present extbf{MOV}, a simple yet effective method for extbf{M}ultimodal extbf{O}pen- extbf{V}ocabulary video classification. In MOV, we directly use the vision encoder from pre-trained VLMs with minimal modifications to encode video, optical flow and audio spectrogram. We design a cross-modal fusion mechanism to aggregate complimentary multimodal information. Experiments on Kinetics-700 and VGGSound show that introducing flow or audio modality brings large performance gains over the pre-trained VLM and existing methods. Specifically, MOV greatly improves the accuracy on base classes, while generalizes better on novel classes. MOV achieves state-of-the-art results on UCF and HMDB zero-shot video classification benchmarks, significantly outperforming both traditional zero-shot methods and recent methods based on VLMs. Code and models will be released.
연구 동기 및 목표
- 훈련 중에 볼 수 없었던 새로운 클래스를 인식할 수 있어야 하는 오픈보이드 비디오 분류 과제를 해결하기 위해.
- 영상 외에 운동 정보(광학 흐름)와 음성 신호를 통합함으로써 영상 전용 모델을 초월한 일반화 성능 향상 여부를 탐구하기 위해.
- 전체 재학습 없이도 사전 훈련된 시각 인코더를 다양한 모달에 효과적으로 활용할 수 있는 단순하면서도 효과적인 방법을 개발하기 위해.
- 기초 클래스에서 높은 정확도를 유지하면서도 신규 클래스에 대한 제로샷 일반화 성능을 향상시키기 위해.
제안 방법
- CLIP와 같은 사전 훈련된 VLM의 시각 인코더를 최소한의 수정으로 영상, 광학 흐름, 음성 스펙트로그램을 모두 처리할 수 있도록 변형한다.
- 다양한 모달 간의 보완적 정보를 통합하기 위해 교차어텐션 융합 기법을 사용하여 공동 표현 학습을 가능하게 한다.
- 멀티모달 입력(영상, 흐름, 음성)을 사용해 기초 클래스에서 시각 인코더를 미세조정하고 언어 인코더는 동결한다.
- 모든 모달에 동일한 ViT-B/16 아키텍처를 사용하며 동일한 초기화를 적용해 입력 간 일관된 특징 학습을 가능하게 한다.
- 다양한 다중모달 융합 기법을 비교하기 위해 점수 융합과 교차어텐션 융합 전략을 적용한다.
- 기초 클래스에서 엔드 투 엔드로 훈련하고, 추론 시에는 신규 클래스에 대한 제로샷 일반화 성능을 평가한다.
실험 결과
연구 질문
- RQ1사전 훈련된 VLM에 광학 흐름과 음성 신호를 통합함으로써 새로운 비디오 클래스에 대한 제로샷 일반화 성능 향상이 이루어지는가?
- RQ2교차어텐션을 통한 다중모달 융합이 간단한 점수 융합에 비해 오픈보이드 비디오 분류에서 어떻게 성능을 높이는가?
- RQ3사전 훈련된 VLM의 통합 시각 인코더가 영상, 흐름, 음성과 같은 다양한 모달을 효과적으로 처리할 수 있는가?
- RQ4시각 인코더의 다양한 레이어를 미세조정할 경우 흐름 및 음성 입력에 대한 성능에 어떤 영향을 미치는가?
- RQ5개별 모달(영상, 흐름, 음성)이 각 클래스의 성능 향상 또는 저하에 기여하는 방식은 어떠한가?
주요 결과
- MOV는 교차어텐션 융합을 통해 Kinetics-700에서 기초 클래스 75.3%의 정확도와 신규 클래스 30.4%의 정확도를 달성하며, 영상 전용 CLIP 대비 각각 2.6%와 3.5% 향상되었다.
- VGGSound에서 MOV는 기초 정확도 68.4%, 신규 정확도 24.8%를 기록했으며, 영상 전용 CLIP 대비 각각 0.7%와 2.0% 향상되었다.
- 시각 인코더의 모든 12개 레이어를 미세조정할 경우 최고의 성능을 기록했으며, 음성에서의 정확도는 마지막 1개 레이어만 미세조정했을 때 30.5%에서 모든 레이어를 미세조정했을 때 59.5%로 상승했다.
- 음성 모달은 시각적으로 유사한 동작(예: 웃는 것 vs 코를 훌러내는 것)을 더 잘 구분하는 데 기여하며, 운동 정보(흐름)는 하품이나 장거리 점프와 같은 역동적인 동작 인식에 도움을 준다.
- 교차어텐션 융합은 항상 점수 융합보다 우수했으며, Kinetics-700에서 신규 클래스 성능을 +3.5% 향상시키고 VGGSound에서는 +2.0% 향상시켰다.
- MOV는 UCF와 HMDB 제로샷 비디오 분류 벤치마크에서 새로운 최신 기술 수준 성능을 수립했으며, 전통적인 제로샷 방법과 최근의 VLM 기반 접근법을 모두 초월했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.