Skip to main content
QUICK REVIEW

[논문 리뷰] MVP-Shot: Multi-Velocity Progressive-Alignment Framework for Few-Shot Action Recognition

Hongyu Qu, Rui Yan|arXiv (Cornell University)|2024. 05. 03.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 다양한 속도로 수행되는 동작를 다루기 위해 다중 시간 스케일(예: 프레임 수준 및 세그먼트 수준) 간의 특징을 공동으로 학습하고 정렬하는 새로운 다중 속도 프로그레시브 정렬 프레임워크인 MVP-Shot을 제안한다. 속도 인식 가능 시맨틱 가이던스를 제공하는 프로그레시브 시맨틱 맞춤 상호작용(PSTI) 모듈과 다중 속도 유사도 융합을 위한 다중 속도 특징 정렬(MVFA) 모듈을 통합함으로써, MVP-Shot은 HMDB51, UCF101, Kinetics, SSv2-small에서 최신 기준 성능(SOTA)을 달성하며, 5-way 1-shot에서 5-shot 설정까지 기존 방법들을 능가한다.

ABSTRACT

Recent few-shot action recognition (FSAR) methods typically perform semantic matching on learned discriminative features to achieve promising performance. However, most FSAR methods focus on single-scale (e.g., frame-level, segment-level, etc) feature alignment, which ignores that human actions with the same semantic may appear at different velocities. To this end, we develop a novel Multi-Velocity Progressive-alignment (MVP-Shot) framework to progressively learn and align semantic-related action features at multi-velocity levels. Concretely, a Multi-Velocity Feature Alignment (MVFA) module is designed to measure the similarity between features from support and query videos with different velocity scales and then merge all similarity scores in a residual fashion. To avoid the multiple velocity features deviating from the underlying motion semantic, our proposed Progressive Semantic-Tailored Interaction (PSTI) module injects velocity-tailored text information into the video feature via feature interaction on channel and temporal domains at different velocities. The above two modules compensate for each other to make more accurate query sample predictions under the few-shot settings. Experimental results show our method outperforms current state-of-the-art methods on multiple standard few-shot benchmarks (i.e., HMDB51, UCF101, Kinetics, and SSv2-small).

연구 동기 및 목표

  • 행동 속도가 다양하지만 대부분의 방법이 한 가지 시간 스케일에서만 정렬하는 소수의 샘플로 행동 인식(FSAR)에서 단일 스케일 특징 정렬의 한계를 해결하기 위해.
  • 프레임 수준 및 세그먼트 수준과 같은 다양한 속도 수준 간의 시맨틱 유사성을 동시에 캡처하여 특징 정렬의 강건성을 향상시키기 위해.
  • 비디오 특징에 속도에 맞는 텍스트 사전 지식을 통합하여 다중 속도 특징가 기초 운동 의미에서 벗어나지 않도록 하기 위해.
  • 낮은 샘플 수 조건에서 더 정확한 쿼리 예측을 위해 다중 속도 매칭 결과를 융합하는 프로그레시브이고 상호보완적인 학습 프레임워크를 개발하기 위해.

제안 방법

  • 프로그레시브 시맨틱 맞춤 상호작용(PSTI) 모듈은 채널 및 시간 도메인 상호작용을 통해 속도별로 특화된 텍스트 임베딩을 비디오 특징에 통합하여 각 속도 스케일에서 시맨틱 정렬을 향상시킨다.
  • 다중 속도 특징 정렬(MVFA) 모듈은 다중 속도 수준에서 지원 및 쿼리 특징 간의 유사도 점수를 계산하고 잔차 방식으로 융합하여 분류 능력을 유지한다.
  • 프레임워크는 프로그레시브 정렬을 수행한다: PSTI가 먼저 클래스 이름 사전 지식을 이용해 속도 인식 특징을 정밀하게 조정하고, 이후 MVFA가 다중 스케일 매칭 신호를 집계한다.
  • 모델은 사전 학습된 CLIP 기반 백본을 사용해 초기 시각적 특징을 추출하고, 소수의 샘플에 적응하기 위해 PSTI 및 MVFA 모듈을 추가로 적용한다.
  • 전체 프레임워크는 에피소드 기반 메타학습을 사용해 엔드 투 엔드로 훈련되며, 예측된 행동 레이블에 대한 교차 엔트로피 손실을 사용한다.
  • 시간 정렬은 OTAM을 측정 기준으로 사용하고, 주의 맵을 시각화하여 모델이 행동 관련 영역에 집중하고 있음을 검증한다.

실험 결과

연구 질문

  • RQ1다양한 행동 속도에서 시맨틱 유사성을 캡처함으로써 다중 속도 특징 정렬이 소수의 샘플로 행동 인식 성능을 향상시킬 수 있는가?
  • RQ2비디오 특징에 속도에 맞는 텍스트 정보를 통합하면 소수의 샘플 행동 예측의 강건성과 정확도에 어떤 영향을 미치는가?
  • RQ3다양한 속도 스케일에서의 유사도 점수 융합이 단일 스케일 정렬보다 더 신뢰성 있고 일관된 예측을 이끌어낼 수 있는가?
  • RQ4기본 시각-언어 모델에 비해 제안된 프레임워크는 배경 및 관련 없는 객체에 대한 주의를 얼마나 줄일 수 있는가?

주요 결과

  • MVP-Shot은 5-way 1-shot에서 5-shot 설정까지 HMDB51, UCF101, Kinetics, SSv2-small에서 최신 기준 성능(SOTA)을 달성하며, 기존 SOTA 방법들을 능가한다.
  • Kinetics에서 MVP-Shot은 5-way 1-shot 정확도 48.7%를 기록하여 이전 SOTA보다 2.1%p 높은 성능을 보였다.
  • 5-way 5-shot 평가에서 MVP-Shot은 UCF101에서 72.3%의 정확도를 달성하여 높은 샘플 수 조건에서도 강력한 일반화 능력을 입증했다.
  • 시각화 결과는 PSTI 모듈이 주의 집중 영역을 크게 향상시켜 말을 타는 이들이나 아이스 댄서와 같은 행동 관련 객체에 집중하는 데 기여했으며, 배경에 대한 주의를 줄였다.
  • MVFA의 다중 속도 정렬은 단일 속도 기반 베이스라인에서의 잘못된 예측를 수정하는 데 성공했으며, Kinetics에서의 유사도 시각화를 통해 다중 스케일 융합이 잘못 분류된 쿼리를 수정하는 데 기여함을 입증했다.
  • 제거 실험 결과, PSTI 및 MVFA 모듈 모두 성능 향상에 기여하며, 둘 중 하나를 제거하면 정확도가 크게 떨어지는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.