[논문 리뷰] Revisiting Classifier: Transferring Vision-Language Models for Video Recognition
이 논문은 CLIP와 같은 시각-언어 모델의 사전 훈련된 텍스트 임베딩을 사용해 표준 선형 분류기 헤드를 대체하는 새로운 비디오 인식 파라다임을 제안한다. 이는 수렴 속도 향상과 최신 기술 수준의 정확도를 달성한다. 텍스트 인코더에서 유래한 의미적 지식을 분류기의 초기화에 활용함으로써, Kinetics-400에서 87.8%의 top-1 정확도를 달성하고, 제로샷 및 희소샷 설정에서 최대 50%의 정확도 향상을 기록한다. 모델 수정이 최소화되고 훈련 효율성이 크게 향상된다.
Transferring knowledge from task-agnostic pre-trained deep models for downstream tasks is an important topic in computer vision research. Along with the growth of computational capacity, we now have open-source vision-language pre-trained models in large scales of the model architecture and amount of data. In this study, we focus on transferring knowledge for video classification tasks. Conventional methods randomly initialize the linear classifier head for vision classification, but they leave the usage of the text encoder for downstream visual recognition tasks undiscovered. In this paper, we revise the role of the linear classifier and replace the classifier with the different knowledge from pre-trained model. We utilize the well-pretrained language model to generate good semantic target for efficient transferring learning. The empirical study shows that our method improves both the performance and the training speed of video classification, with a negligible change in the model. Our simple yet effective tuning paradigm achieves state-of-the-art performance and efficient training on various video recognition scenarios, i.e., zero-shot, few-shot, general recognition. In particular, our paradigm achieves the state-of-the-art accuracy of 87.8% on Kinetics-400, and also surpasses previous methods by 20~50% absolute top-1 accuracy under zero-shot, few-shot settings on five popular video datasets. Code and models can be found at https://github.com/whwu95/Text4Vis .
연구 동기 및 목표
- 시각-언어 사전 훈련 모델의 전이 가능성 향상을 위해 텍스트 인코더 지식을 활용하기 위해.
- 비디오 인식을 위한 표준 미세조정 파이프라인에서 텍스트 인코더가 충분히 활용되지 않는 문제를 해결하기 위해.
- 무작위 초기화된 분류기 헤드를 사전 훈련된 텍스트 임베딩의 의미적 지식으로 대체하여 성능과 훈련 속도를 향상시키기 위해.
- 최소한의 계산 비용으로 강력한 희소샷 및 제로샷 성능을 가능하게 하여 효율적인 비디오 인식의 민주화를 위해.
제안 방법
- 표준 선형 분류기 헤드를 시각-언어 모델의 텍스트 인코더에서 사전 추출한 고정된 텍스트 임베딩으로 대체한다.
- CLIP 모델의 텍스트 인코더를 사용해 각 클래스 레이블에 대한 의미 벡터를 생성하고, 이를 분류기의 가중치 행렬로 사용한다.
- 교차 엔트로피 손실을 사용해 시각 인코더만 엔드 투 엔드로 훈련하고, 텍스트 분류기 가중치는 동결한다.
- 다양한 초기화 전략을 비교: 무작위, 직교, 시각-통계 기반(LDA), 의미적-텍스트 임베딩.
- 배치 수집이 필요하고 텍스트 인코더를 업데이트하는 대비 기반 대안을 사용한다.
- 공정한 비교와 다중 GPU를 통한 효율적 훈련을 위해 분산 데이터 병렬 훈련을 사용한다.
실험 결과
연구 질문
- RQ1시각-언어 모델의 사전 훈련된 텍스트 임베딩이 비디오 분류에서 시각적 표현의 전이 가능성에 기여할 수 있는가?
- RQ2무작위 또는 직교 초기화와 비교해 의미적 텍스트 벡터를 분류기 가중치로 사용할 경우 정확도와 수렴 속도에서 어떤 차이가 있는가?
- RQ3텍스트 인코더를 동결하고 시각 인코더만 미세조정할 경우 최종 비디오 인식 성능에 어떤 영향을 미치는가?
- RQ4기존의 대비 기반 파라다임과 비교해 제안된 방법이 제로샷 및 희소샷 설정에서 어떻게 성능을 내는가?
- RQ5매우 낮은 훈련 비용과 FLOPs로 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- 이 방법은 Kinetics-400에서 87.8%의 top-1 정확도를 달성하여 비디오 인식 분야에서 새로운 최고 기록을 수립한다.
- 기존 방법과 비교해 다섯 개의 비디오 데이터셋에서 제로샷 및 희소샷 정확도를 20–50% 점수 향상시켰다.
- 대비 기반 기준선 대비 훈련 시간을 2배 단축시켰다(8장의 V100 GPU에서 10시간), 이는 배치 수집이 필요하고 더 긴 훈련 기간을 요구하기 때문이다.
- 동일한 정확도에서 ViViT-L/16-320 대비 29배 높은 처리량과 44배 적은 FLOPs를 기록해 뛰어난 효율성을 입증했다.
- ViT-B/16를 사용할 경우, 단지 3.3 V100일의 훈련으로 81.5%의 top-1 정확도를 달성했으며, 대비 기반 방법보다 0.8% 높고 더 빠른 수렴 속도를 보였다.
- 다중 시각 평가 프로토콜을 적용하면 성능이 82.9%의 top-1 정확도로 더욱 향상되어 이 방법의 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.