Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-modal Prompting for Low-Shot Temporal Action Localization

Chen Ju, Zeqian Li|arXiv (Cornell University)|2023. 03. 21.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 저샷 시간 행동 탐지를 위한 다중 모odal 프롬프팅 프레임워크를 제안하며, 대규모 언어 모델에서 유도된 상세한 텍스트 기술과 RGB 및 광학 흐름 특징에서 유도된 시각 조건 프롬프트 벡터를 활용하여 개방형 어휘 행동 분류를 향상시킨다. 시각, 텍스트, 운동 모달리티를 공유된 임bedding 공간에서 정렬함으로써, 이 방법은 최신 기술 수준의 성능을 달성하여 기존 방법 대비 제로샷 설정에서 THUMOS14에서 mAP를 10퍼센트 이상 향상시킨다.

ABSTRACT

In this paper, we consider the problem of temporal action localization under low-shot (zero-shot & few-shot) scenario, with the goal of detecting and classifying the action instances from arbitrary categories within some untrimmed videos, even not seen at training time. We adopt a Transformer-based two-stage action localization architecture with class-agnostic action proposal, followed by open-vocabulary classification. We make the following contributions. First, to compensate image-text foundation models with temporal motions, we improve category-agnostic action proposal by explicitly aligning embeddings of optical flows, RGB and texts, which has largely been ignored in existing low-shot methods. Second, to improve open-vocabulary action classification, we construct classifiers with strong discriminative power, i.e., avoid lexical ambiguities. To be specific, we propose to prompt the pre-trained CLIP text encoder either with detailed action descriptions (acquired from large-scale language models), or visually-conditioned instance-specific prompt vectors. Third, we conduct thorough experiments and ablation studies on THUMOS14 and ActivityNet1.3, demonstrating the superior performance of our proposed model, outperforming existing state-of-the-art approaches by one significant margin.

연구 동기 및 목표

  • 범주 이름이 '펜싱'과 같이 여러 개의 다른 행동을 가리킬 수 있는 열거적 모호성 문제를 해결하기 위해.
  • 대규모 언어 모델(Large Language Models, LLMs)을 사용하여 특성-rich 텍스트 프롬프트를 생성함으로써 분류기의 구분 능력을 향상시키기 위해.
  • 새로운 행동 범주를 위한 인스턴스별 프롬프팅을 가능하게 하기 위해 RGB 및 광학 흐름 특징에서 시각 프롬프트 벡터를 학습하기 위해.
  • RGB, 광학 흐름, 텍스트 모달리티 간의 임베딩을 명시적으로 정렬함으로써 범주에 종속되지 않는 행동 제안을 향상시키기 위해.
  • 미리보지 않은 범주에 대해 훈련이 필요 없이 표준 벤치마크에서 강건한 제로샷 및 소량 샘플 설정 성능을 달성하기 위해.

제안 방법

  • 클래스에 종속되지 않는 행동 제안을 수행하는 두 단계의 트랜스포머 기반 검출 아키텍처를 사용하며, 이후 개방형 어휘 분류를 수행한다.
  • RGB 프레임, 광학 흐름 시퀀스, 텍스트 임베딩을 함께 통합하여 공유된 공간에 임bed딩하는 다중 모달 정렬 헤드를 도입한다.
  • 텍스트 프롬프팅을 위해, LLM을 사용하여 '어떤 도구가 [행동]에 필요합니까?'와 같은 구조적 템플릿을 통해 도구, 행동, 설정 등의 특성 기술을 생성한다.
  • 시각 조건 프롬프팅을 위해, 입력 영상의 시각적 특징에서 인스턴스별 프롬프트 벡터를 계산하고 CLIP 텍스트 인코더에 통합한다.
  • 대비 학습을 사용하여 영상 제안을 해당 텍스트 프롬프트와 정렬하며, 광학 흐름을 강력한 운동 신호로 활용한다.
  • 절단 실험을 통해 각 구성 요소의 기여도를 검증하였으며, 이는 유량 주입, LLM 프롬프팅, 시각 조건 프롬프팅을 포함한다.

실험 결과

연구 질문

  • RQ1LLM가 생성한 특성 기술 기반의 기술이 개방형 어휘 행동 분류에서 어휘적 모호성을 효과적으로 해결할 수 있는가?
  • RQ2포괄적인 기술이 어려운 경우, 시각적 특징을 활용한 시각 조건 프롬프팅이 분류기 성능을 어떻게 향상시키는가?
  • RQ3RGB, 유량, 텍스트의 삼중 모달 정렬이 범주에 종속되지 않는 행동 제안 및 탐지 정확도를 얼마나 향상시키는가?
  • RQ4표준 벤치마크인 THUMOS14 및 ActivityNet1.3에서 제로샷 및 소량 샘플 설정에서 모델의 일반화 능력은 어떠한가?
  • RQ5광학 흐름이 저샷 시간 행동 탐지에서 성능 향상에 기여하는 상대적 기여도는 어느 정도인가?

주요 결과

  • 제안된 방법은 기존 최신 기술 수준의 방법 대비 제로샷 설정에서 THUMOS14에서 mAP를 10퍼센트 이상 향상시켜 뚜렷한 향상 효과를 보였다.
  • 광학 흐름의 포함은 모든 설정에서 성능 향상을 일관되게 유도하였으며, 제로샷 시나리오에서 THUMOS14에서 10퍼센트 이상의 향상이 이루어졌다.
  • 포괄적인 기술이 어려운 경우, 순수 텍스트 기반 프롬프팅보다 시각 조건 프롬프팅이 더 높은 성능을 보였다.
  • LLM가 생성한 특성 기술(예: 도구, 행동, 설정)의 사용은 특히 모호한 범주 이름에서 분류기의 구분 능력을 크게 향상시켰다.
  • 새로운 범주당 1~2개의 샘플만으로도 소량 샘플 성능이 제로샷 기반선을 크게 초월하여 강력한 소량 샘플 일반화 능력을 입증하였다.
  • 정성적 결과에서는, 지속 시간과 수의 다양성이 큰 행동을 강건하게 탐지하는 것으로 나타났으며, 광학 흐름이 RGB 단독 입력에서 발생하는 탐지 오류를 수정하는 데 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.