[논문 리뷰] MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
이 논문은 경량 다중모달 어댑터와 텍스트 유도형 프로토타입 구축 모듈을 도입하여 CLIP의 파라미터 효율적인 적응 방법인 MA-CLIP을 제안한다. CLIP의 백본을 동결하고 오직 18.54M 파라미터만 미세조정함으로써, MA-CLIP는 15% 높은 성능을 기록한 단일모달 기반 모델과 10% 향상된 CLIP-FSAR보다도 뛰어난 최신 기술 수준의 정확도를 달성하며, 동시에 학습 시간과 메모리 사용량을 80% 이상 감소시켰다.
Applying large-scale vision-language pre-trained models like CLIP to few-shot action recognition (FSAR) can significantly enhance both performance and efficiency. While several studies have recognized this advantage, most of them resort to full-parameter fine-tuning to make CLIP's visual encoder adapt to the FSAR data, which not only costs high computations but also overlooks the potential of the visual encoder to engage in temporal modeling and focus on targeted semantics directly. To tackle these issues, we introduce MA-FSAR, a framework that employs the Parameter-Efficient Fine-Tuning (PEFT) technique to enhance the CLIP visual encoder in terms of action-related temporal and semantic representations. Our solution involves a Fine-grained Multimodal Adaptation, which is different from the previous attempts of PEFT in regular action recognition. Specifically, we first insert a Global Temporal Adaptation that only receives the class token to capture global motion cues efficiently. Then these outputs integrate with visual tokens to enhance local temporal dynamics by a Local Multimodal Adaptation, which incorporates text features unique to the FSAR support set branch to highlight fine-grained semantics related to actions. In addition to these token-level designs, we propose a prototype-level text-guided construction module to further enrich the temporal and semantic characteristics of video prototypes. Extensive experiments demonstrate our superior performance in various tasks using minor trainable parameters.
연구 동기 및 목표
- 제한된 레이블이 부여된 비디오 데이터와 높은 계산 비용을 동반하는 소수의 액션 인식 과제를 해결한다.
- 비디오의 추가 시간 차원을 모델링하는 데 어려움을 겪는 사전학습된 이미지 모델(예: CLIP)의 한계를 극복한다.
- 과적합을 방지하고 다양한 작업 간에 신속하고 효율적인 전이 학습을 가능하게 하기 위해 학습 가능한 파라미터 수를 최소화한다.
- 다중모달 비디오-텍스트 정보를 활용하여 시공간 표현과 프로토타입 학습을 향상시킨다.
- 다양한 시간 정렬 메트릭과 호환되는 플러그 앤 플레이 프레임워크를 개발한다.
제안 방법
- CLIP의 이미지 및 텍스트 인코더를 동결하고 비디오-텍스트 다중모달 융합을 위한 경량 어댑터를 추가함으로써 파라미터 효율적인 미세조정(PEFT)을 적용한다.
- 주의 메커니즘을 사용하여 텍스트적 맥락을 통합함으로써 비디오 프로토타입 표현을 향상시키는 텍스트 유도형 프로토타입 구축 모듈을 설계한다.
- CLIP의 시각적 스트림에 어댑터를 통합하여 태스크에 특화된 시공간 모델링을 가능하게 하면서도 모델의 일반화 능력을 유지한다.
- 비디오 및 텍스트 특징을 동시에 처리하는 다중모달 어댑터를 사용하여 시간 모델링과 특징 정렬을 향상시킨다.
- OTAM 또는 TRX와 같은 다양한 소수의 액션 인식 메트릭과 통합이 가능한 플러그 앤 플레이 설계를 구현한다.
- 주요 CLIP 가중치를 동결하면서도 최소한의 파라미터(18.54M)로 어댑터 헤드를 학습시켜 과적합과 학습 비용을 감소시킨다.
![Figure 1: Performance comparison of different few-shot action recognition methods under the 5-way 1-shot settings on the SSv2-Small dataset, including our MA-CLIP , OTAM [ 3 ] , TRX [ 33 ] , STRM [ 38 ] , HyRSM [ 46 ] , and CLIP-FSAR [ 44 ] . Bubble or star size indicates the recognition accuracy. O](https://ar5iv.labs.arxiv.org/html/2308.01532/assets/x1.png)
실험 결과
연구 질문
- RQ1CLIP의 파라미터 효율적인 적응이 학습 가능한 파라미터 수를 최소화하면서도 소수의 액션 인식 성능을 향상시킬 수 있는가?
- RQ2저데이터 환경에서 다중모달 비디오-텍스트 정보를 얼마나 효과적으로 활용하여 시공간 표현을 향상시킬 수 있는가?
- RQ3텍스트 유도형 프로토타입 구축 기법이 소수의 설정에서 비디오 프로토타입 학습을 향상시키는가?
- RQ4전체 미세조정 또는 기존 기반 모델 대비 MA-CLIP는 학습 비용과 메모리 사용량을 얼마나 줄이는가?
- RQ5아키텍처 변경 없이 MA-CLIP가 다양한 시간 정렬 메트릭에 일반화 가능한가?
주요 결과
- MA-CLIP는 SSv2-Small 및 Kinetics 데이터셋에서 모두 ImageNet으로 사전학습된 단일모달 모델보다 최소 15% 높은 정확도를 기록했으며, CLIP로 사전학습된 단일모달 모델보다는 10% 높은 성능을 보였다.
- 5-way 1-shot 설정에서 MA-CLIP는 CLIP-FSAR 및 다른 기반 모델들을 능가하며, 조정 가능한 파라미터 수가 가장 적은 상태에서 가장 높은 인식 정확도를 달성했다.
- 학습 가능한 파라미터 수를 18.54M(전체 미세조정의 1/5)로 줄였고, 단일 RTX 3090에서 메모리 사용량을 1.6GB 감소시키고 학습 시간을 0.4시간 단축시켰다.
- 주의 시각화 결과, MA-CLIP가 액션 관련 객체에 더 집중하고 배경에 대한 주의를 줄임을 확인하여 개선된 시공간 정렬 능력을 보였다.
- ImageNet 기반 모델이 요구하는 작업 수의 1/4만으로 훈련되었을 때도 MA-CLIP는 SSv2-Small에서 15% 높은 정확도를 기록하여 뛰어난 데이터 효율성을 입증했다.
- 플러그 앤 플레이 설계 덕분에 MA-CLIP는 다양한 시간 정렬 메트릭과 원활하게 통합되며, 다양한 설정에서도 뛰어난 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.