Skip to main content
QUICK REVIEW

[논문 리뷰] FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition

Xiaohu Huang, Hao Zhou|arXiv (Cornell University)|2024. 02. 05.
Natural Language Processing Techniques인용 수 4
한 줄 요약

FROSTER는 일반화 능력을 유지하면서도 비디오 전용 특징 학습을 가능하게 하기 위해 고정된 CLIP 모델을 교사로 사용하는 지식 정련 프레임워크를 제안한다. 잔차 특징 정련을 적용함으로써 FROSTER는 다양한 벤치마크에서 최신 기술 수준의 성능을 달성하며, 특히 일반화 능력이 요구되는 분포 외 데이터셋에서 뛰어난 성능을 보인다.

ABSTRACT

In this paper, we introduce FROSTER, an effective framework for open-vocabulary action recognition. The CLIP model has achieved remarkable success in a range of image-based tasks, benefiting from its strong generalization capability stemming from pretaining on massive image-text pairs. However, applying CLIP directly to the open-vocabulary action recognition task is challenging due to the absence of temporal information in CLIP's pretraining. Further, fine-tuning CLIP on action recognition datasets may lead to overfitting and hinder its generalizability, resulting in unsatisfactory results when dealing with unseen actions. To address these issues, FROSTER employs a residual feature distillation approach to ensure that CLIP retains its generalization capability while effectively adapting to the action recognition task. Specifically, the residual feature distillation treats the frozen CLIP model as a teacher to maintain the generalizability exhibited by the original CLIP and supervises the feature learning for the extraction of video-specific features to bridge the gap between images and videos. Meanwhile, it uses a residual sub-network for feature distillation to reach a balance between the two distinct objectives of learning generalizable and video-specific features. We extensively evaluate FROSTER on open-vocabulary action recognition benchmarks under both base-to-novel and cross-dataset settings. FROSTER consistently achieves state-of-the-art performance on all datasets across the board. Project page: https://visual-ai.github.io/froster.

연구 동기 및 목표

  • 미세조정된 CLIP 모델이 오픈-보기어드레스션 액션 인식에서 일반화 능력이 떨어지는 문제를 해결한다. 특히 새로운 또는 의미적으로 거리가 먼 액션 카테고리에서의 성능 향상을 목표로 한다.
  • 이미지 기반 CLIP 사전학습과 비디오 액션 인식 간의 도메인 갭을 극복하기 위해, CLIP의 강력한 일반화 능력을 유지하면서도 비디오 전용 특징 학습을 가능하게 한다.
  • 모델 앙상블의 계산 비용을 피하기 위해, 고정된 CLIP의 지식과 비디오 전용 학생 모델을 통합하는 경량이고 효율적인 프레임워크를 개발한다.
  • 완전히 미세조정된 모델과 어댑터 기반 모델을 포함한 다양한 네트워크 아키텍처와의 호환성을 확보하여 실용적 적용 가능성을 극대화한다.

제안 방법

  • 학습 중 CLIP의 시각 및 텍스트 인코더를 고정하여, 일반화 가능한 표현을 유지하는 지식 정련 교사로 활용한다.
  • 잔차 특징 정련 도입: 학생 모델은 고정된 CLIP의 특징과 학생 자신의 특징 간 잔차를 예측하도록 학습함으로써, 비디오 전용 특징과 일반화 가능한 특징을 동시에 최적화할 수 있도록 한다.
  • 비디오 전용 특징 학습(미세조정를 통한)과 일반화 가능한 특징 학습(정련을 통한)을 분리하기 위해 잔차 서브넷을 사용하여 두 목표 간 균형을 이룬다.
  • 비교적 정제된 일반화 능력의 퇴화를 방지하기 위해 프로젝터가 없는 설계를 통해 시각적 및 텍스처 특징 모두에 정련을 적용한다.
  • 텍스트 증강(예: 클래스 이름 강화)을 통합하여 텍스트 일반화 능력을 향상시키고, 제로샷 전이 성능을 향상시킨다.
  • 평가 시점에 학생 모델과 고정된 CLIP을 특징 수준의 앙상블로 결합하여 지식 정련의 효과를 검증하지만, 최종 모델은 단일 학생 모델로 작동한다.

실험 결과

연구 질문

  • RQ1고정된 CLIP 모델이 미세조정 없이도 비디오 액션 인식에서 일반화 능력을 향상시키기 위해 효과적인 지식 정련 교사로 기능할 수 있는가?
  • RQ2잔차 특징 정련이 비디오 전용 특징 학습과 CLIP의 일반화 능력 유지 간에 효과적으로 균형을 이룰 수 있는가?
  • RQ3FROSTER는 오픈-보기어드레스션 벤치마크에서, 특히 훈련 세트와 의미적으로 거리가 먼 데이터셋에서 어떻게 성능을 내는가?
  • RQ4FROSTER의 성능 향상은 일반화 요구가 높은 상황에서 증가하는가? 예를 들어, UCF-101이나 HMDB-51에 비해 Kinetics-600에서 성능 향상이 더 크며, 일반화 요구가 높은 상황에서의 성능 향상이 뚜렷한가?
  • RQ5FROSTER는 완전히 미세조정된 모델과 어댑터 기반 모델을 포함한 다양한 아키텍처에 효과적으로 적용될 수 있는가?

주요 결과

  • FROSTER는 평가된 모든 벤치마크에서 최신 기술 수준의 성능을 달성했으며, 기준-노버 노드 설정에서 Kinetics-600에서 85.0%의 상위-1 정확도를 기록하여 앙상블 방법조차도 능가했다.
  • Kinetics-600는 Kinetics-400와 가장 높은 의미적 거리(Hausdorff 거리)를 가지며, FROSTER는 이에 대해 가장 큰 상대적 향상을 기록하여 고일반화 요구 상황에서의 효과성을 확인했다.
  • 잔차 특징 정련은 표준 정련 및 프로젝터 기반 정련보다 우수하며, 텍스트 증강과 조합했을 때 Kinetics-600에서 74.8%의 상위-1 정확도를 기록했다.
  • 모든 데이터셋에서 성능 향상이 관찰되었으며, K-600에서 가장 큰 성과 향상(기준 대비 약 7.5% 상승)을 기록하여 강력한 일반화 능력 향상을 확인했다.
  • FROSTER는 다양한 아키텍처에서 효과적이다. 완전히 미세조정된 모델과 어댑터 기반 모델 모두에서 성능 향상을 이끌었으며, 더 높은 파라미터 용량 덕분에 후자의 경우 더 큰 향상률을 기록했다.
  • 어텐션 시각화 결과 FROSTER는 고정된 CLIP가 배경에 집중하는 것과 달리, 움직이는 물체(예: 손)와 관련 배경 요소(예: kitchen sink, 테이블)에 집중하는 것으로 확인되었으며, 미세조정된 모델가 빠질 수 있는 핵심 운동 신호를 효과적으로 포착한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.