[논문 리뷰] Seeing in Flowing: Adapting CLIP for Action Recognition with Motion Prompts Learning
이 논문은 두 개의 스트림으로 구성된 운동 모델링 블록(MMB)을 통해 명시적으로 운동 힌트를 모델링함으로써 CLIP을 영상 동작 인식에 적응시키는 새로운 방법을 제안한다. 이 방법은 동적 프롬프트 학습기를 운동 인식 프롬프트(MAP)를 생성하도록 이끈다. 제안된 방법은 추가 파라미터와 계산 비용을 최소화하면서도, HMDB-51, UCF-101, Kinetics-400에서 소수의 샘플 및 제로샷 인식 설정에서 최신 기술 수준(SOTA) 성능을 달성한다.
The Contrastive Language-Image Pre-training (CLIP) has recently shown remarkable generalization on "zero-shot" training and has applied to many downstream tasks. We explore the adaptation of CLIP to achieve a more efficient and generalized action recognition method. We propose that the key lies in explicitly modeling the motion cues flowing in video frames. To that end, we design a two-stream motion modeling block to capture motion and spatial information at the same time. And then, the obtained motion cues are utilized to drive a dynamic prompts learner to generate motion-aware prompts, which contain much semantic information concerning human actions. In addition, we propose a multimodal communication block to achieve a collaborative learning and further improve the performance. We conduct extensive experiments on HMDB-51, UCF-101, and Kinetics-400 datasets. Our method outperforms most existing state-of-the-art methods by a significant margin on "few-shot" and "zero-shot" training. We also achieve competitive performance on "closed-set" training with extremely few trainable parameters and additional computational costs.
연구 동기 및 목표
- 소수의 레이블된 데이터로 인한 과제를 해결하기 위해 소수 샘플 일반화 성능을 향상시키는 것.
- CLIP의 정적 프롬프트의 한계를 극복하기 위해 운동 유도 동적 프롬프트 학습을 도입하는 것.
- 명시적인 운동 모델링과 다중 모달 협업을 통해 미리 보지 않은 동작 카테고리에 대한 CLIP의 제로샷 일반화 성능을 향상시키는 것.
- 최소한의 학습 가능한 파라미터와 계산 비용을 유지하면서도 CLIP의 강력한 일반화 능력을 유지하는 것.
제안 방법
- 비디오 프레임 간 표현 차이를 분석하여 단기 및 장기 운동 힌트를 캡처하는 두 개의 스트림으로 구성된 운동 모델링 블록(MMB)을 도입한다.
- 추출된 운동 특징을 기반으로 동적 프롬프트 학습기를 조건화하여 의미적으로 더 풍부하고 동작에 특화된 운동 인식 프롬프트(MAP)를 생성한다.
- 시각적 및 텍스처적 특징 간의 상호작용을 가능하게 하여 협업 학습을 촉진하기 위해 다중 모달 커뮤니케이션 블록(MCB)을 설계한다.
- CLIP의 이미지 인코더 가중치를 동결하여 사전 학습된 일반화 능력을 유지하면서, MMB, MAP, MCB 구성 요소만 미세조정한다.
- 운동 힌트에 따라 이끌리는 클로즈 스타일 템플릿으로 구성된 프롬프트를 사용하여 영상-텍스트 쌍에서 대비 학습을 수행한다.
- 두 단계 학습 전략을 적용: 먼저 닫힌 세트 모드에서 Kinetics-400에서 사전 학습을 수행하고, 이후 추가 조정 없이 제로샷 모드에서 HMDB-51 및 UCF-101로 전이한다.
실험 결과
연구 질문
- RQ1낮은 데이터 환경에서 명시적인 운동 모델링이 CLIP의 동작 인식 성능 향상에 기여하는가?
- RQ2정적 프롬프트와 비교했을 때, 운동 유도 동적 프롬프트 학습이 프롬프트의 다양성과 동작에 특화된 의미 이해를 어떻게 향상시키는가?
- RQ3커뮤니케이션 블록을 통한 다중 모달 협업이 제로샷 및 소수 샘플 일반화 성능 향상에 얼마나 기여하는가?
- RQ4최소한의 파라미터 업데이트 전략이 CLIP의 일반화 능력을 유지하면서도 표준 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- HMDB-51에서 제안된 방법은 2-shot 학습 조건에서 기준 모델 대비 19.6%의 상대적 정확도 향상을 기록했으며, 최신 기술 수준의 방법들보다 뚜렷한 우위를 보였다.
- UCF-101에서 1%의 학습 데이터로 2-shot 모델이 기존 최고 성능을 기록한 X-CLIP을 +6.0% 초과하여, 더 뛰어난 소수 샘플 일반화 성능을 입증했다.
- 제로샷 평가에서, HMDB-51에서 X-CLIP을 +5.5% 초과하고 UCF-101에서 +4.4% 초과했으며, 데이터셋 간 전이 시 UCF-101에서 28.9%의 급격한 향상을 기록했다.
- 5-shot 학습 조건에서 Kinetics-400에서도 경쟁력 있는 성능을 기록했으며, 기존 최신 기술 수준 방법보다 +3.0%의 상대적 Top-1 정확도 향상을 기록했고, 학습 데이터의 1% 미만으로도 달성했다.
- 모델은 추가로 420만 개의 파라미터와 0.03 GFLOPs의 추가 계산량만을 사용하여 뛰어난 일반화 능력을 유지하면서도 매우 효율적인 성능를 달성했다.
- 제거 실험 결과, MMB, MAP, MCB 각각이 기여도가 뚜렷하며, 이들의 조합이 소수 샘플 및 제로샷 설정 모두에서 가장 높은 성능 향상을 이끌었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.