Skip to main content
QUICK REVIEW

[논문 리뷰] CAST: Cross-Attention in Space and Time for Video Action Recognition

Dong-Ho Lee, Jongseo Lee|arXiv (Cornell University)|2023. 11. 30.
Human Pose and Action Recognition인용 수 5
한 줄 요약

CAST는 RGB 입력만을 사용하여 공간 전문가 네트워크와 시간 전문가 네트워크 간의 교차 attention을 통해 균형 잡힌 시공간 이해를 달성하는 이중 스트림 비디오 행동 인식 모델을 제안한다. 복합적인 정보 교환을 가능하게 하는 병목 아키텍처를 통해 CAST는 다양한 데이터셋에서 최신 기준인 조화 평균 정확도 77.9%를 달성하며, 정적 및 시간적 편향이 있는 벤치마크에서 모두 기존 방법을 능가하는 균형 잡힌 성능을 보인다.

ABSTRACT

Recognizing human actions in videos requires spatial and temporal understanding. Most existing action recognition models lack a balanced spatio-temporal understanding of videos. In this work, we propose a novel two-stream architecture, called Cross-Attention in Space and Time (CAST), that achieves a balanced spatio-temporal understanding of videos using only RGB input. Our proposed bottleneck cross-attention mechanism enables the spatial and temporal expert models to exchange information and make synergistic predictions, leading to improved performance. We validate the proposed method with extensive experiments on public benchmarks with different characteristics: EPIC-KITCHENS-100, Something-Something-V2, and Kinetics-400. Our method consistently shows favorable performance across these datasets, while the performance of existing methods fluctuates depending on the dataset characteristics.

연구 동기 및 목표

  • 기존 비디오 행동 인식 모델에서 흔히 발생하는 시공간 이해의 불균형 문제를 해결하기 위해.
  • 광학 흐름이나 다중 모odal 입력에 의존하지 않고 정적 편향 및 시간적 편향이 있는 데이터셋 모두에서 성능을 향상시키기 위해.
  • 공간 전문가와 시간 전문가가 교차 attention을 통해 상호 보완적으로 행동 예측을 수행하는 이중 스트림 아키텍처를 설계하기 위해.
  • 병목 구조에서 교차 attention 메커니즘이 균형 잡힌 표현 학습을 가능하게 하는지 검증하기 위해.
  • 다양한 특성을 지닌 다양한 비디오 행동 인식 벤치마크에서 일관된 성능을 보여주기 위해.

제안 방법

  • 모델은 공간적 맥락을 처리하는 공간 전문가 네트워크와 시간적 동역학을 처리하는 시간 전문가 네트워크를 갖춘 두 개의 전문가 네트워크를 사용한다. 두 네트워크 모두 RGB 비디오 클립을 처리한다.
  • 공간 전문가와 시간 전문가 간의 교차 attention을 적용하여 双방향 정보 교환과 상호 보완적 예측을 가능하게 한다.
  • 교차 attention 메커니즘은 특징 정제 및 학습 효율성을 향상시키기 위해 병목 아키텍처에 배치된다.
  • 최종 예측은 두 전문가의 예측을 가중 조합하여 그 상호 보완적 강점을 활용한다.
  • 행동 분류 작업에서 표준 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 제거 실험을 통해 두 전문가 스트림과 병목 교차 attention 설계의 필요성을 검증한다.

실험 결과

연구 질문

  • RQ1공간 전문가와 시간 전문가 간의 교차 attention을 갖는 이중 스트림 아키텍처가 단일 스트림 모델보다 더 우수한 균형 잡힌 시공간 이해를 달성할 수 있는가?
  • RQ2표준 attention 또는 조기 융합과 비교해 병목 교차 attention 메커니즘이 표현 학습을 향상시키는가?
  • RQ3정적(예: Kinetics-400), 시간적(예: Something-So), 세밀한(예: EPIC-KITCHENS-100) 특성을 지닌 다양한 데이터셋에서 제안된 방법의 성능은 어떠한가?
  • RQ4기존 방법의 성능이 다양한 데이터셋 간에 심각하게 불균형한가? 그리고 CAST는 이 문제를 완화할 수 있는가?
  • RQ5각 전문가 스트림과 교차 attention 메커니즘이 전체 성능에 기여하는 정도는 어떠한가?

주요 결과

  • CAST는 EK100, SSV2, K400에서 조화 평균 정확도 77.9%를 달성하여, 같은 지표에서 AIM(75.4%)과 VideoMAE(75.8%)를 모두 능가한다.
  • K400 데이터셋에서 CAST는 85.3%의 top-1 정확도를 기록하여 VideoMAE(81.5%)를 초월하고, 이 벤치마크에서 가장 높은 성능을 기록한 방법과 동등하다.
  • SSV2 데이터셋에서 CAST는 71.6%의 top-1 정확도를 기록하여 VideoMAE(70.8%)를 초월하고, 시간적 편향이 있는 이 벤치마크에서 AIM(68.1%)에 비해 뚜렷이 뛰어나다.
  • 세밀한 EPIC-KITCHENS-100 데이터셋에서 CAST는 49.3%의 행동 정확도를 기록하여 비교된 방법들 중 두 번째로 높은 순위를 차지한다.
  • 제거 실험 결과, 공간 전문가와 시간 전문가 양쪽 모두가 필수적이며, 병목 교차 attention 메커니즘이 기준 모델 대비 성능 향상을 크게 이룬다는 것이 확인되었다.
  • CAST는 모든 데이터셋에서 일관되고 유리한 성능을 보이며, 기존 방법보다 더 균형 잡힌 시공간 이해를 가능하게 한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.