Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition

Xinzhe Ni, Yong Liu|arXiv (Cornell University)|2022. 12. 09.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 CLIP 기반 텍스트 인코더와 다중모달 프로토타입 향상(MPE) 모듈을 통해 레이블 텍스트의 의미 정보를 활용해 시각적 프로토타입을 향상시키는 소수 샘플 동작 인식 모델인 다중모달 프로토타입 향상 네트워크(MORN)를 제안한다. MORN은 시각적 및 텍스트적 프로토타입을 공동 최적화함으로써 HMDB51, UCF101, Kinetics, SSv2에서 최신 기준 성능(SOTA)을 달성하며, 훈련 중에 새로운 프로토타입 품질 지표인 PRIDE를 사용할 경우 추가적인 성능 향상을 얻는다.

ABSTRACT

Current methods for few-shot action recognition mainly fall into the metric learning framework following ProtoNet, which demonstrates the importance of prototypes. Although they achieve relatively good performance, the effect of multimodal information is ignored, e.g. label texts. In this work, we propose a novel MultimOdal PRototype-ENhanced Network (MORN), which uses the semantic information of label texts as multimodal information to enhance prototypes. A CLIP visual encoder and a frozen CLIP text encoder are introduced to obtain features with good multimodal initialization. Then in the visual flow, visual prototypes are computed by a visual prototype-computed module. In the text flow, a semantic-enhanced (SE) module and an inflating operation are used to obtain text prototypes. The final multimodal prototypes are then computed by a multimodal prototype-enhanced (MPE) module. Besides, we define a PRototype SImilarity DiffErence (PRIDE) to evaluate the quality of prototypes, which is used to verify our improvement on the prototype level and effectiveness of MORN. We conduct extensive experiments on four popular few-shot action recognition datasets: HMDB51, UCF101, Kinetics and SSv2, and MORN achieves state-of-the-art results. When plugging PRIDE into the training stage, the performance can be further improved.

연구 동기 및 목표

  • 소수 샘플 동작 인식에서 단일모달 프로토타입의 한계를 해결하기 위해, 제한된 레이블 데이터로 인해 최적의 프로토타입 표현이 어려운 문제를 다룬다.
  • 레이블 텍스트의 의미 정보를 보완 모odal로 활용하여 프로토타입 품질과 분류 성능을 향상시키기 위해 노력한다.
  • 단순하지만 효과적인 프레임워크를 설계하여, 단순히 특징 수준 융합이 아닌 다중모달 융합을 통한 프로토타입 향상 방식을 제안한다.
  • 프로토타입 품질 향상의 평가 및 지도를 위한 새로운 지표인 프로토타입 유사도 차이(PRIDE)를 도입한다.
  • 고품질 프로토타입이 소수 샘플 학습에서 매우 중요하며, 다중모달 향상이 성능 향상에 크게 기여한다는 것을 입증한다.

제안 방법

  • 강력한 제로샷 일반화 성능을 확보하기 위해 고정된 CLIP 시각 인코더와 고정된 CLIP 텍스트 인코더를 사용하여 다중모달 특징을 초기화한다.
  • 비디오 클립 내 시간적 관계를 모델링하기 위해 시간관계 교차Transformer(TRX) 모듈을 사용하여 시각적 프로토타입을 계산한다.
  • 레이블 텍스트에서 온라인된 특징을 개선하기 위해 다중헤드 어텐션을 사용하는 의미 강화(SE) 모듈을 적용한 후, 차원을 일치시키기 위해 팽창 연산을 수행한다.
  • 가중 평균 또는 어텐션 기반 융합을 사용하여 시각적 및 텍스트 프로토타입을 다중모달 프로토타입 향상(MPE) 모듈을 통해 융합하여 최종 다중모달 프로토타입을 생성한다.
  • 프로토타입의 자기 카테고리와 다른 카테고리 평균 간의 유사도 차이를 계산하는 지표인 PRIDE를 도입하여 프로토타입 품질을 평가한다.
  • PRIDE를 훈련 목표에 통합하여 프로토타입 품질과 모델 성능을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1레이블 텍스트에서 유추하는 의미 정보를 통합함으로써 소수 샘플 동작 인식에서 프로토타입의 표현력이 향상될 수 있는가?
  • RQ2시각적 및 텍스트 프로토타입을 융합하는 다중모달 프로토타입 향상 방식이 단일모달 또는 특징 수준 융합 방식보다 더 높은 성능을 낼 수 있는가?
  • RQ3PRIDE와 같은 전용 지표가 소수 샘플 학습에서 프로토타입 품질 향상의 평가 및 지도에 효과적으로 기여할 수 있는가?
  • RQ4PRIDE 손실을 사용한 훈련이 다양한 벤치마크에서 일관된 성능 향상을 가져오는가?
  • RQ5SE 모듈, MPE 융합 전략, 텍스트 인코더 고정과 같은 설계 선택 사항이 최종 성능에 미치는 영향은 어떠한가?

주요 결과

  • MORN은 네 가지 벤치마크 데이터셋에서 최신 기준 성능(SOTA)을 달성한다: HMDB51(86.3%), UCF101(96.9%), Kinetics(91.6%), SSv2(71.1%)이며, 이는 이전 방법들을 초월한다.
  • 고정된 CLIP 텍스트 인코더와 의미 강화(SE) 모듈을 함께 사용할 경우, HMDB51, UCF101, Kinetics에서 성능 향상이 뚜렷하며, 이 두 구성 요소를 모두 사용할 때 최고의 성능를 기록한다.
  • SSv2에서는 고정된 CLIP 텍스트 인코더를 사용하고 SE 모듈을 사용하지 않은 경우 72.8%의 정확도를 달성하여, 이 데이터셋에서는 SE 모듈의 중요성이 다소 낮다는 것을 시사한다.
  • 제거 분석 결과, SE 모듈에서 다중헤드 어텐션(4헤드)을 사용하고, 하이퍼파rameter λ = 0.5를 설정할 경우 HMDB51에서 최적의 성능를 얻을 수 있다.
  • MPE 모듈에서 8헤드 어텐션을 사용할 경우 HMDB51, UCF101, Kinetics에서 최고의 성능를 기록하며, 단순 가중 평균 방식은 더 적은 파라미터로 두 번째로 높은 성능를 기록한다.
  • 훈련 단계에 PRIDE를 통합할 경우 추가적인 성능 향상이 이루어지며, 이는 PRIDE가 프로토타입 품질 향상의 평가 및 개선에 효과적으로 작용한다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.