[논문 리뷰] Few-shot Action Recognition with Captioning Foundation Models
이 논문은 사전에 학습된 캡션 생성 기초 모델(BLIP)을 활용하여 비디오의 자동 텍스트 기술을 생성함으로써 수동 주석 없이 다중모달 지식을 효과적으로 활용할 수 있도록 하는 플러그 앤 플레이 프레임워크인 CapFSAR를 제안한다. 비디오의 시각적 특징과 합성 텍스트 특징을 트랜스포머 기반의 시각-텍스트 통합 모듈을 통해 융합함으로써 CapFSAR는 여러 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 1-샷 정확도에서 시각 전용 기반 모델보다 최대 3.4% 향상되었다.
Transferring vision-language knowledge from pretrained multimodal foundation models to various downstream tasks is a promising direction. However, most current few-shot action recognition methods are still limited to a single visual modality input due to the high cost of annotating additional textual descriptions. In this paper, we develop an effective plug-and-play framework called CapFSAR to exploit the knowledge of multimodal models without manually annotating text. To be specific, we first utilize a captioning foundation model (i.e., BLIP) to extract visual features and automatically generate associated captions for input videos. Then, we apply a text encoder to the synthetic captions to obtain representative text embeddings. Finally, a visual-text aggregation module based on Transformer is further designed to incorporate cross-modal spatio-temporal complementary information for reliable few-shot matching. In this way, CapFSAR can benefit from powerful multimodal knowledge of pretrained foundation models, yielding more comprehensive classification in the low-shot regime. Extensive experiments on multiple standard few-shot benchmarks demonstrate that the proposed CapFSAR performs favorably against existing methods and achieves state-of-the-art performance. The code will be made publicly available.
연구 동기 및 목표
- 소수 샘플 동작 인식에서 레이블이 부족한 문제를 기초 모델의 다중모달 지식을 활용하여 해결하고자 한다.
- 비디오 데이터셋에 대한 수동 텍스트 주석의 높은 비용과 비현실성 문제를 해결하고자 한다.
- 비디오에 대해 고품질의 캡션을 자동으로 생성하여 시각적 표현 학습을 향상시키는 플러그 앤 플레이 프레임워크를 개발하고자 한다.
- 합성 텍스트 기술이 소수 샘플 인식 성능 향상에 얼마나 효과적인지 탐색하고자 한다.
- 시각-언어 기초 모델에서 유래한 다중모달 지식이 저자원 동작 인식 작업으로 효과적으로 전이될 수 있음을 입증하고자 한다.
제안 방법
- 입력 비디오 클립에서 특징을 추출하기 위해 BLIP의 시각 인코더를 활용한다.
- 각 비디오 입력에 대해 자연어 기술(합성 캡션)을 생성하기 위해 BLIP의 캡션 디코더를 사용한다.
- 생성된 캡션을 문맥 기반 텍스트 임베딩으로 변환하기 위해 텍스트 인코더(예: DeBERTa 또는 CLIP)를 적용한다.
- 시각적 특징과 텍스트 특징 간의 다중모달 시공간 상호작용을 모델링하기 위해 트랜스포머 기반의 시각-텍스트 통합 모듈을 도입한다.
- 학습된 어텐션 메커니즘을 통해 다중모달 표현을 융합하여 시간 인식 능력과 분류 정확도를 향상시킨다.
- 소수 샘플 분류를 위해 메트릭 기반 메타학습 프레임워크를 사용하여 엔드 투 엔드로 프레임워크를 훈련시킨다.
실험 결과
연구 질문
- RQ1시각-언어 기초 모델에서 자동으로 생성된 캡션은 소수 샘플 동작 인식 성능을 향상시킬 수 있는가?
- RQ2합성 텍스트 기술과 시각적 특징의 융합은 저샷 학습 환경에서 얼마나 효과적인가?
- RQ3다양한 텍스트 인코더가 다중모달 소수 샘플 인식 프레임워크 성능에 미치는 영향은 어떠한가?
- RQ4생성된 캡션의 품질은 최종 분류 정확도에 어떤 영향을 미치는가?
- RQ5제안된 프레임워크는 다양한 동작 복잡도와 시각적 특성을 가진 다양한 벤치마크에서 일반화 가능한가?
주요 결과
- CapFSAR는 Kinetics 및 SSv2-Full을 포함한 다섯 개의 표준 소수 샘플 동작 인식 벤치마크에서 최신 기술 수준의 성능을 달성하였다.
- Kinetics 데이터셋에서 CapFSAR는 시각 전용 기반 모델 OTAM†의 1-샷 정확도를 3.4% 향상시켰다(85.8% 대비 82.4%).
- 운동 중심의 SSv2-Full 데이터셋에서는 DeBERTa를 텍스트 인코더로 사용할 경우 최고의 성능를 기록했고, 외관 중심의 Kinetics 데이터셋에서는 CLIP가 가장 우수한 성능를 보였다.
- 더 큰 캡션 생성 모델과 더 많은 사전학습 데이터는 더 고품질의 캡션과 더 나은 최종 인식 정확도를 유도한다.
- 정성 분석 결과, 생성된 캡션은 일반적으로 핵심 동작 동사와 물체(예: "pushing car"에서의 "car")를 포함하여 모델이 특징적인 영역에 집중하는 데 기여한다.
- 실패 사례는 주로 시각적 모호성으로 인한 정확하지 않은 캡션 생성(예: 수박을 공으로 잘못 인식)으로 인해 발생하며, 이는 캡션 품질에 강하게 의존함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.