Skip to main content
QUICK REVIEW

[논문 리뷰] FitCLIP: Refining Large-Scale Pretrained Image-Text Models for Zero-Shot Video Understanding Tasks

Santiago Castro, Fabian Caba Heilbron|arXiv (Cornell University)|2022. 03. 24.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

FitCLIP는 CLIP과 같은 대규모 사전 학습된 이미지-텍스트 모델을 제로샷 비디오 이해 작업에 적응시키기 위해 힘의 기반 미세조정 전략을 제안한다. 레이블이 부여된 비디오 데이터와 가짜 레이블이 부여된 비디오 데이터로 훈련된 학생 네트워크를 사용하고, 교사 모델(CLIP)과 가중치 공간 앙상블을 통해 융합함으로써 FitCLIP는 여러 벤치마크에서 제로샷 행동 인식 및 텍스트-비디오 검색 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, 추가 추론 비용 없이 CLIP의 성능을 초월한다.

ABSTRACT

Large-scale pretrained image-text models have shown incredible zero-shot performance in a handful of tasks, including video ones such as action recognition and text-to-video retrieval. However, these models have not been adapted to video, mainly because they do not account for the time dimension but also because video frames are different from the typical images (e.g., containing motion blur, and less sharpness). In this paper, we present a fine-tuning strategy to refine these large-scale pretrained image-text models for zero-shot video understanding tasks. We show that by carefully adapting these models we obtain considerable improvements on two zero-shot Action Recognition tasks and three zero-shot Text-to-video Retrieval tasks. The code is available at https://github.com/bryant1410/fitclip

연구 동기 및 목표

  • 이미지와 비디오 데이터 사이의 도메인 갭이 CLIP와 같은 대규모 이미지-텍스트 모델의 제로샷 비디오 작업 성능을 제한하는 문제를 해결하기 위해.
  • 추론 비용을 들이지 않으면서도 원본 모델의 강건성 손실 없이 제로샷 비디오 이해 성능을 향상시키는 미세조정 전략을 개발하기 위해.
  • 지식 힘과 가중치 공간 앙상블이 사전 학습된 이미지-텍스트 모델에 비디오 특화 지식을 효과적으로 전달하는지 검증하기 위해.
  • 다양한 비디오 데이터셋을 사용하여 제로샷 행동 인식 및 텍스트-비디오 검색에 대한 새로운 벤치마크를 수립하기 위해.
  • 가짜 레이블링을 통한 비디오 데이터 기반 미세조정이 제로샷 능력을 크게 향상시키면서도 모델의 일반화 능력을 유지할 수 있는지 보여주기 위해.

제안 방법

  • FitCLIP는 소규모 레이블이 부여된 비디오 데이터셋과 대규모 가짜 레이블이 부여된 비디오 데이터로 훈련된 학생 네트워크를 사용하여 비디오 특화 표현을 학습한다.
  • 이 방법은 사전 학습된 CLIP 교사 모델에서 학생 모델로 지식 힘을 수행하여 비디오 입력에 대한 시각적 및 텍스트 특징을 정렬한다.
  • 핵심 혁신은 가중치 공간 앙상블의 사용으로, 학생의 가중치와 교사의 가중치를 융합하여 일반적인 이미지 지식과 비디오 특화 적응을 결합한 최종 모델을 생성한다.
  • 학생 모델은 진짜 레이블과 교사 모델의 로짓을 모두 예측하도록 훈련되어, 비디오 특화 특성(예: 운동 블러, 해상도 저하)에 적응하면서 지식 전이를 가능하게 한다.
  • 이 방법은 주로 두 가지 작업에 적용된다: 제로샷 행동 인식과 제로샷 텍스트-비디오 검색이며, 여러 벤치마크 데이터셋을 사용한다.
  • 최종 모델은 추론 시 추가 비용 없이 평가되며, 앙상블된 가중치가 그대로 추론 시점에 사용된다.

실험 결과

연구 질문

  • RQ1힘 기반 미세조정이 CLIP와 같은 이미지-텍스트 모델의 제로샷 비디오 이해 작업 성능을 향상시킬 수 있는가?
  • RQ2가중치 공간 앙상블은 학생 네트워크로부터 비디오 특화 지식을 통합하면서도 교사 모델의 강건성을 유지하는 데 기여하는가?
  • RQ3FitCLIP의 성능은 제로샷 행동 인식 및 텍스트-비디오 검색 벤치마크에서 CLIP 및 기타 최신 기술 수준 모델과 비교해 어떻게 되는가?
  • RQ4대규모 비디오 데이터에 대해 가짜 레이블링을 수행함으로써 제로샷 전이 성능이 얼마나 향상되는가?
  • RQ5다양한 비디오 데이터 분포(예: 1인칭 시점, 편집되지 않은, 지침형)에서의 훈련이 최종 제로샷 성능에 미치는 영향은 어느 정도인가?

주요 결과

  • FitCLIP는 제로샷 텍스트-비디오 검색에서 새로운 최신 기술 수준 성능을 달성하였으며, DiDeMo에서 CLIP 대비 3.8% 향상, MSR-VTT에서 4.7%, MiT에서 1.9% 향상되었다.
  • 제로샷 행동 인식에서 FitCLIP는 UCF101에서 CLIP의 정확도를 74.5%에서 73.3%로 향상시키고, MiT에서는 19.9%에서 21.8%로 상승시켰다.
  • 학생 네트워크에서 온 성능 향상은 모든 데이터셋에서 일관되게 나타나며, 교사 모델 대비 0.9%에서 4.7%까지 향상되었다.
  • 가중치 공간 앙상블 단계는 필수적이다: 다양한 데이터셋에서 조건이 달라도 교사 모델의 성능을 유지하거나 향상시켰다.
  • 비록 제로샷 방법이지만, 일부 벤치마크에서는 예를 들어 YouCook2에서 CAMoE와 같은 감독 학습 모델을 초월하는 성능을 보였으며, 최고의 감독 학습 방법에는 아직 뒤지지 않았다.
  • 이 방법은 힘과 함께 대규모 가짜 레이블이 부여된 비디오 데이터 기반 미세조정이 추론 비용 없이 이미지-비디오 도메인 갭을 효과적으로 줄일 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.