Skip to main content
QUICK REVIEW

[논문 리뷰] M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition

Mengmeng Wang, Jiazheng Xing|arXiv (Cornell University)|2024. 01. 22.
Human Pose and Action Recognition인용 수 4
한 줄 요약

M2-CLIP는 CLIP을 개선하기 위해 시각적 및 텍스트 어댑터와 다중 작업 디코더를 도입한 다중모odal, 다중작업 적응 프레임워크를 제안하며, 최소한의 학습 가능 파라미터로 상태의 기준을 달성한다. 이는 UCF101과 HMDB51에서 이전 방법들을 능가하는 제로샷 성능을 보이며, Vita-CLIP보다 41% 적은 파라미터를 사용한다.

ABSTRACT

Recently, the rise of large-scale vision-language pretrained models like CLIP, coupled with the technology of Parameter-Efficient FineTuning (PEFT), has captured substantial attraction in video action recognition. Nevertheless, prevailing approaches tend to prioritize strong supervised performance at the expense of compromising the models' generalization capabilities during transfer. In this paper, we introduce a novel Multimodal, Multi-task CLIP adapting framework named ame to address these challenges, preserving both high supervised performance and robust transferability. Firstly, to enhance the individual modality architectures, we introduce multimodal adapters to both the visual and text branches. Specifically, we design a novel visual TED-Adapter, that performs global Temporal Enhancement and local temporal Difference modeling to improve the temporal representation capabilities of the visual encoder. Moreover, we adopt text encoder adapters to strengthen the learning of semantic label information. Secondly, we design a multi-task decoder with a rich set of supervisory signals to adeptly satisfy the need for strong supervised performance and generalization within a multimodal framework. Experimental results validate the efficacy of our approach, demonstrating exceptional performance in supervised learning while maintaining strong generalization in zero-shot scenarios.

연구 동기 및 목표

  • CLIP 기반 영상 행동 인식에서 감독 학습 성능와 제로샷 일반화 간의 상충 관계를 해결하기 위해.
  • 새로운 어댑터 아키텍처를 통해 시각 인코더를 강화하여 영상 표현에서 시간적 모델링을 향상시키기 위해.
  • 전용 텍스트 브랜치 어댑터를 통해 액션 레이블에 대한 텍스트 특징 학습을 강화하기 위해.
  • 다중 작업 디코더를 통해 여러 감독 신호를 통합하여 정확도와 강건성을 향상시키기 위해.
  • 최소한의 미세조정 파라미터로 높은 성능을 달성하면서도 CLIP의 일반화 능력을 유지하기 위해.

제안 방법

  • 영상 표현 학습을 향상시키기 위해 전역 시간적 강화와 국소 시간적 차이 모델링을 수행하는 시각적 TED-어댑터를 도입한다.
  • 액션 레이블의 의미 정보를 더 잘 포착하기 위해 CLIP 텍스트 인코더에 경량 텍스트 어댑터를 적용한다.
  • 다중 작업 디코더를 설계하며, 대비 학습 헤드, 교차모달 분류 헤드, 교차모달 마스킹 언어 모델링 헤드, 시각적 특징 분류기로 구성된다.
  • 기존 CLIP 백본을 동결하고 어댑터 및 디코더 헤드만 학습함으로써 파라미터 효율적인 미세조정을 구현한다.
  • 대비 학습, 교차모달 분류, 마스킹 언어 모델링, 시각적 분류를 공동 목표로 하여 특징 정렬과 분류 능력을 향상시킨다.
  • 즉시 통합 가능한 모듈식 설계를 채택하여 기존 CLIP 기반 영상 인식 프레임워크에 쉽게 통합할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1다중모달, 다중작업 적응 프레임워크는 CLIP의 제로샷 일반화 능력을 유지하면서도 영상 행동 인식에서 강력한 감독 학습 성능을 달성할 수 있는가?
  • RQ2전용 시각 어댑터(TED-어댑터)는 영상 시퀀스의 전역 및 국소 시간적 동역학을 얼마나 효과적으로 모델링하는가?
  • RQ3고정된 CLIP 백본에서 액션 레이블에 대한 분류 가능한 특징 학습에 텍스트 어댑터를 추가하면 어떤 영향을 미치는가?
  • RQ4다중 작업 디코더에 포함된 다중 감독 신호가 성능 향상과 특징 분리에 얼마나 기여하는가?
  • RQ5파라미터 효율적인 다중모달 적응 프레임워크는 전체 미세조정 및 프롬프트 기반 방법보다 제로샷 및 감독 설정 모두에서 승리할 수 있는가?

주요 결과

  • M2-CLIP는 전체 CLIP 모델의 파라미터의 0.4%만을 사용하여 감독 학습에서 Kinetics-400에서 83.4%의 정확도를 달성한다.
  • UCF101에서 M2-CLIP는 제로샷 정확도 94.1%를 기록하여 이전의 모든 방법들을 능가하며, 파라미터가 2.4배 많은 Vita-CLIP보다도 뛰어나다.
  • HMDB51에서 M2-CLIP는 제로샷 정확도 68.5%를 달성하여 대부분의 베이스라인을 능가하고, 최고 성능을 기록한 방법과 동일한 성능을 내지만, 학습 가능한 파라미터의 41%만을 사용한다.
  • 제거 분석 결과, 다중 작업 디코더가 크게 기여하며, 대비 헤드 외에 시각적 특징 분류기 헤드를 추가함으로써 성능이 0.7% 향상됨을 확인하였다.
  • 시간적 강화와 차이 모델링을 모두 포함한 TED-어댑터가 가장 뛰어난 성능을 보이며, 단일 구성 요소만을 사용하는 변형보다 뛰어난 성능을 기록한다.
  • 텍스트 어댑터를 하나만 추가할 경우 최적의 성능을 달성하며, 더 많은 어댑터를 추가할 경우 과적합이 발생하고 감독 및 제로샷 벤치마크에서 성능 저하가 발생한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.