Skip to main content
QUICK REVIEW

[논문 리뷰] Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models

Wenhao Wu, Xiaohan Wang|arXiv (Cornell University)|2022. 12. 31.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 비디오 입력에서 텍스트 특징를 생성하고 텍스트-비디오 정렬을 통한 카테고리 종속 시간적 중요도를 추출하여 사전 훈련된 시각-언어 모델(VLM)을 활용해 비디오 인식을 위한 이중 방향 교차 모odal 지식 탐색 프레임워크인 BIKE를 제안한다. 이 방법은 CLIP를 사용하여 Kinetics-400에서 88.6%의 최고 성능을 기록하며, 일반, 제로샷, 소수 샘플 인식 설정에서 이전의 CLIP 기반 접근법을 모두 능가한다.

ABSTRACT

Vision-language models (VLMs) pre-trained on large-scale image-text pairs have demonstrated impressive transferability on various visual tasks. Transferring knowledge from such powerful VLMs is a promising direction for building effective video recognition models. However, current exploration in this field is still limited. We believe that the greatest value of pre-trained VLMs lies in building a bridge between visual and textual domains. In this paper, we propose a novel framework called BIKE, which utilizes the cross-modal bridge to explore bidirectional knowledge: i) We introduce the Video Attribute Association mechanism, which leverages the Video-to-Text knowledge to generate textual auxiliary attributes for complementing video recognition. ii) We also present a Temporal Concept Spotting mechanism that uses the Text-to-Video expertise to capture temporal saliency in a parameter-free manner, leading to enhanced video representation. Extensive studies on six popular video datasets, including Kinetics-400 & 600, UCF-101, HMDB-51, ActivityNet and Charades, show that our method achieves state-of-the-art performance in various recognition scenarios, such as general, zero-shot, and few-shot video recognition. Our best model achieves a state-of-the-art accuracy of 88.6% on the challenging Kinetics-400 using the released CLIP model. The code is available at https://github.com/whwu95/BIKE .

연구 동기 및 목표

  • 사전 훈련된 시각-언어 모델(VLM)이 비디오 인식에서 제한적으로 활용되고 있는 문제, 특히 비디오에서 텍스트로의 단방향 매칭 사용에 대응하기 위해.
  • VLM의 교차 모달 브리지 역할을 통해 시각적 및 텍스트적 모달 간의 이중 방향 지식 전이를 탐색하기 위해.
  • 보조 텍스트 특징와 시간적 중요도를 도입하여 일반, 제로샷, 소수 샘플 인식 시나리오에서 비디오 인식 성능을 향상시키기 위해.
  • 비디오 데이터에 대한 추가 훈련 없이도 비디오 표현을 향상시킬 수 있는 단순하면서도 효과적인 프레임워크를 개발하기 위해.

제안 방법

  • 사용자 정의된 어휘 사전을 활용해 각 비디오에 가장 관련성이 높은 특징를 추출하고, 이를 Attributes Recognition Branch에서 사용하는, 입력 비디오에서 보조 텍스트 특징를 생성하기 위한 Video-Attributes Association 메커니즘을 도입한다.
  • 사전 정의된 어휘 사전을 활용해 각 비디오에 가장 관련성이 높은 특징를 추출하며, 이를 Attributes Recognition Branch에서 활용한다.
  • 각 프레임과 주어진 카테고리 간의 상관관계를 측정하여, 시간적 중요도를 프레임 단위로 계산하는 Temporal Concept Spotting 메커니즘을 제안한다.
  • 중요도 점수를 적용하여 비디오 특징의 가중치가 부여된 시간적 집약을 수행함으로써, 보다 압축되고 대표적인 비디오 임베딩을 생성한다.
  • Attributes 브랜치와 Video 브랜치를 융합하여 이중 스트림 프레임워크인 BIKE를 구성함으로써, 인식 성능을 공동으로 향상시킨다.
  • 교차 모달 정렬을 위한 기초로 CLIP 모델을 사용하며, 이로 인해 텍스트 및 시각 신호의 파rameter-free 통합이 가능하다.

실험 결과

연구 질문

  • RQ1사전 훈련된 VLM에서 생성된 보조 텍스트 특징는 표준 비디오-텍스트 매칭을 초월해 비디오 인식을 향상시킬 수 있는가?
  • RQ2텍스트-비디오 지식은 카테고리 종속 시간적 중요도를 통해 어떻게 비디오 표현을 향상시킬 수 있는가?
  • RQ3VLM에서 유도된 이중 방향 교차 모달 지식 탐색은 제로샷 및 소수 샘플 설정을 포함한 다양한 비디오 인식 시나리오에서 일관된 성능 향상을 이끌 수 있는가?
  • RQ4보조 특징의 효과는 모델 규모와 백본 용량에 얼마나 의존하는가?

주요 결과

  • 제안된 BIKE 프레임워크는 공개된 CLIP ViT-B/32 백본을 사용하여 Kinetics-400 데이터셋에서 최고 성능인 88.6%의 top-1 정확도를 달성한다.
  • Attributes 브랜치만으로도 Kinetics-400에서 69%의 top-1 정확도를 기록하며, 생성된 텍스트 특징가 보완 신호로서의 가치를 입증한다.
  • Attributes 브랜치와 결합했을 때 Video Concept Spotting 메커니즘이 성능을 1.4% 향상시키며, 비디오 표현 향상에 효과적임을 확인한다.
  • 더 큰 ViT-L/14 백본을 사용할 경우 Attributes 브랜치에서 추가적인 성능 향상이 없음을 관찰하였으며, 이는 더 큰 모델이 더 균형 잡힌 표현을 학습하고 보조 특징의 필요성을 감소시킴을 시사한다.
  • 동일한 ViT-B/32 백본을 사용할 때 VideoPrompt와 ActionCLIP보다 3.0% 높은 성능을 기록하며, CLIP 기반 비디오 인식에서의 우수성을 확인한다.
  • BIKE는 Kinetics-400, UCF-101, HMDB-51, ActivityNet, Charades 등 다양한 데이터셋에서 일반, 제로샷, 소수 샘플 인식 작업 전반에 걸쳐 일관된 성능 향상을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.