Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Shot Temporal Action Detection via Vision-Language Prompting

Sauradip Nag, Xiatian Zhu|arXiv (Cornell University)|2022. 07. 17.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 종류에 관계없이 학습된 표현 마스킹 모듈을 갖춘 병렬 헤드를 통해 국소화와 분류를 분리함으로써 오류 전파를 방지하고 엔드 투 엔드 최적화를 가능하게 하는 새로운 일단계(one-stage) 제로샷 시간 행동 탐지 모델인 STALE을 제안한다. STALE은 제로샷 TAD 벤치마크에서 최신 기술을 초월하는 성능을 달성하며, 기존의 강력한 감독 기반 베이스라인을 초월한다.

ABSTRACT

Existing temporal action detection (TAD) methods rely on large training data including segment-level annotations, limited to recognizing previously seen classes alone during inference. Collecting and annotating a large training set for each class of interest is costly and hence unscalable. Zero-shot TAD (ZS-TAD) resolves this obstacle by enabling a pre-trained model to recognize any unseen action classes. Meanwhile, ZS-TAD is also much more challenging with significantly less investigation. Inspired by the success of zero-shot image classification aided by vision-language (ViL) models such as CLIP, we aim to tackle the more complex TAD task. An intuitive method is to integrate an off-the-shelf proposal detector with CLIP style classification. However, due to the sequential localization (e.g, proposal generation) and classification design, it is prone to localization error propagation. To overcome this problem, in this paper we propose a novel zero-Shot Temporal Action detection model via Vision-LanguagE prompting (STALE). Such a novel design effectively eliminates the dependence between localization and classification by breaking the route for error propagation in-between. We further introduce an interaction mechanism between classification and localization for improved optimization. Extensive experiments on standard ZS-TAD video benchmarks show that our STALE significantly outperforms state-of-the-art alternatives. Besides, our model also yields superior results on supervised TAD over recent strong competitors. The PyTorch implementation of STALE is available at https://github.com/sauradip/STALE.

연구 동기 및 목표

  • 학습 데이터 없이도 알려지지 않은 행동 클래스를 인식할 수 있도록 하는 제로샷 시간 행동 탐지(ZS-TAD) 문제에 대응한다.
  • 제안된 이중 단계(ZS-TAD) 방법이 제안 생성과 분류를 순차적으로 처리함으로써 발생하는 국소화 오류 전파 문제를 해결한다.
  • 비전-언어(ViL) 모델(예: CLIP)을 활용하여 새로운 행동 클래스에 대한 효과적인 제로샷 전이를 가능하게 하는 새로운 프롬프팅 및 적응 메커니즘을 개발한다.
  • 저자원 환경에서 일반화 성능을 향상시키기 위해 비디오 이해 과제에서 시각적 표현과 텍스트 표현 간의 교차 모odal 정렬을 향상시킨다.
  • 국소화와 분류를 동시에 최적화할 수 있는 통합된 엔드 투 엔드 학습 가능한 프레임워크를 개발하여, 이전 방법에서 발생하는 고정된 국소화 헤드와 분류 헤드 간의 불일치 문제를 해결한다.

제안 방법

  • 국소화와 분류를 병렬로 처리하는 일단계 아키텍처를 제안하여 두 작업을 분리함으로써 국소화 오류가 분류로 전파되는 것을 방지한다.
  • 학습 가능한, 클래스에 종속되지 않은 표현 마스킹 모듈을 도입하여 비디오 특징에서 전경 마스크를 생성함으로써 알려지지 않은 행동 클래스에 대한 제로샷 일반화를 가능하게 한다.
  • 자연어로 기술된 행동 클래스에 대한 프롬프팅을 통해 시각-언어 모델(CLIP 스타일)을 활용하여 제로샷 분류를 수행하며, 사전 학습된 시각적 및 텍스트 인코더를 활용한다.
  • Transformer 기반 프레임워크에서 자기 어텐션을 활용한 스트림 간 정렬 정규화를 구현하여 시각적 특징과 언어 특징 간의 교차 모달 일관성을 향상시킨다.
  • 행동 분류를 위한 의미적 맥락을 더 잘 포착하기 위해 최대 50개 토큰의 학습 가능한 텍스트 맥락을 설계하여 고정 또는 짧은 프롬프팅보다 성능 향상을 이룬다.
  • 시간적 모델링을 위해 위치 인코딩 없이 다중 헤드 Transformer를 적용하여 비디오 시퀀스의 장거리 의존성을 효과적으로 포착하며, 1D-CNN 및 MS-TCN 베이스라인을 능가한다.

실험 결과

연구 질문

  • RQ1제로샷 환경에서 시간 행동 탐지에 대해 일단계 병렬 아키텍처가 국소화와 분류 간 오류 전파를 제거할 수 있는가?
  • RQ2학습 가능한, 클래스에 종속되지 않은 표현 마스킹 모듈이 알려지지 않은 행동 클래스에 대한 제로샷 일반화에 얼마나 효과적인가?
  • RQ3시각적 특징과 언어 특징 간의 교차 모달 정렬이 제로샷 시간 행동 탐지 성능에 얼마나 기여하는가?
  • RQ4고정 또는 짧은 프롬프팅 대비 가변 길이의 학습 가능한 텍스트 맥락이 분류 정확도 향상에 기여하는가?
  • RQ5제안된 STALE 모델이 제로샷 외에도 완전히 감독된 시간 행동 탐지 설정에서 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • STALE은 ActivityNet의 75% 볼 수 있는 분할에서 평균 정밀도(mAP) 38.2%를 달성하여 제로샷 시간 행동 탐지에서 기존 최신 기술 방법을 크게 앞서며 성능을 높였다.
  • 제거 분석 결과, 텍스트 인코더의 미세조정이 mAP를 1.3% 향상시켜(36.9% → 38.2%) TAD 과제에 대한 도메인 적응의 중요성을 입증했다.
  • 1D-CNN(29.0%) 및 MS-TCN(33.5%) 대비 동일한 제로샷 설정에서 Transformer를 사용한 경우 mAP가 38.2%로 높아졌으며, 이는 장거리 맥락 모델링 능력이 뛰어나다는 것을 확인했다.
  • 비전에서 언어로의 교차 적응을 포함한 스트림 간 정렬 정규화는 mAP를 1.4% 향상시켜(23.5% → 24.9%) 최소한의 계산 오버헤드로 성능 향상을 이뤘다.
  • 맥락 토큰 수를 10개에서 50개로 늘일 경우 mAP가 36.3%에서 38.2%로 상승하여, 더 긴 맥락 시퀀스가 ZS-TAD 성능 향상에 기여함을 시사했다.
  • STALE는 감독 기반 TAD 설정에서도 뛰어난 성능을 달성하여 ActivityNet 및 THUMOS 벤치마크에서 최근 강력한 경쟁자들을 능가했으며, 제로샷 학습을 넘어서는 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.