Skip to main content
QUICK REVIEW

[논문 리뷰] MM-ViT: Multi-Modal Video Transformer for Compressed Video Action Recognition

Jiawei Chen, Chiu Man Ho|arXiv (Cornell University)|2021. 08. 20.
Human Pose and Action Recognition인용 수 8
한 줄 요약

이 논문은 I-프레임, 동작 벡터, 잔차 및 오디오를 활용하여 압축된 비디오 도메인에서 직접 작동하는 순수 트랜스포머 기반 모델인 MM-ViT를 제안한다. 공간, 시간 및 모odal 간의 자기주의를 인수분해하고 새로운 다중모달 주의 메커니즘을 사용하여 UCF-101, Something- Something-v2 및 Kinetics-600에서 최신 기술을 초월하는 정확도와 효율성을 달성한다.

ABSTRACT

This paper presents a pure transformer-based approach, dubbed the Multi-Modal Video Transformer (MM-ViT), for video action recognition. Different from other schemes which solely utilize the decoded RGB frames, MM-ViT operates exclusively in the compressed video domain and exploits all readily available modalities, i.e., I-frames, motion vectors, residuals and audio waveform. In order to handle the large number of spatiotemporal tokens extracted from multiple modalities, we develop several scalable model variants which factorize self-attention across the space, time and modality dimensions. In addition, to further explore the rich inter-modal interactions and their effects, we develop and compare three distinct cross-modal attention mechanisms that can be seamlessly integrated into the transformer building block. Extensive experiments on three public action recognition benchmarks (UCF-101, Something-Something-v2, Kinetics-600) demonstrate that MM-ViT outperforms the state-of-the-art video transformers in both efficiency and accuracy, and performs better or equally well to the state-of-the-art CNN counterparts with computationally-heavy optical flow.

연구 동기 및 목표

  • 광학 흐름 또는 단일 모달 입력에 의존하는 기존 비디오 행동 인식 모델에서의 비효율성과 다중모달 활용의 제한을 해결하기 위해.
  • 압축된 비디오 도메인에서 직접 작동하는 순수 트랜스포머 아키텍처를 개발하여, RGB 프레임으로의 디코딩 및 광학 흐름 계산의 고비용을 피하기 위해.
  • 외관(이미지 프레임), 운동(동작 벡터 및 잔차), 오디오 특징 간의 효과적인 다중모달 상호작용을 통합된 주의 메커니즘 내에서 가능하게 하기 위해.
  • 공간, 시간 및 모달 차원에 걸쳐 자기주의를 인수분해하여 계산 복잡도를 감소시키면서도 높은 정확도를 달성하기 위해.
  • 다중모달 트랜스포머가 광학 흐름 기반의 컨볼루션 신경망(CNN)과 비교해도 성능을 극복하거나 능가할 수 있으며, 더 높은 효율성을 보여주기 위해.

제안 방법

  • MM-ViT는 RGB 프레임으로 디코딩하지 않고도 I-프레임, 동작 벡터, 잔차 및 오디오 웨이브포워밍을 입력 모달로 사용하여 압축된 비디오 도메인에서만 작동한다.
  • 계산 복잡도를 줄이기 위해 공간, 시간 및 모달 차원에 걸쳐 자기주의를 인수분해하는 확장 가능한 모델 버전을 도입한다.
  • 시각적 및 청각 모달 간의 풍부한 상호작용을 가능하게 하기 위해 세 가지 별도의 다중모달 주의 메커니즘을 설계한다.
  • 4차원 시공간-모달 주의 메커니즘을 사용하여 비디오에 대한 비전 트랜스포머 원칙을 다중 입력 모달로 확장한다.
  • 주의 맵을 시각화하기 위해 Attention Rollout 방법을 활용하며, 이는 모델이 의미적으로 관련 있는 영역과 동작을 효과적으로 집중함을 보여준다.
  • 표준 학습 및 추론 프로토콜을 사용하여 세 가지 벤치마크에서 평가함으로써 최신 기술 방법과의 공정한 비교를 확보한다.

실험 결과

연구 질문

  • RQ1압축된 비디오 도메인에서 직접 작동하면서도 광학 흐름 계산을 피하는 순수 트랜스포머 모델이 높은 정확도를 달성할 수 있는가?
  • RQ2공간, 시간 및 모달 차원에서 자기주의를 인수분해하는 기법이 성능을 유지하면서도 계산 비용을 줄이는 데 얼마나 효과적인가?
  • RQ3새로운 다중모달 주의 메커니즘이 I-프레임, 동작 벡터, 잔차 및 오디오 간의 상호작용을 효과적으로 모델링하여 행동 인식 성능을 향상시킬 수 있는가?
  • RQ4다중모달 트랜스포머 접근법이 고비용 광학 흐름 특징에 의존하는 최신 기술의 CNN보다 성능이 뛰어나거나 동등한가?
  • RQ5UCF-101, Something- Something-v2 및 Kinetics-600와 같은 다양한 행동 인식 벤치마크에서 모델의 일반화 능력은 얼마나 우수한가?

주요 결과

  • UCF-101에서 MM-ViT는 3×8×224² 해상도로 66.7%의 top-1 정확도를 기록하여 ViViT-L 및 Timesformer-L를 능가하며, 광학 흐름 기반 CNN보다 정확도는 높고 효율성은 더 뛰어나다.
  • Something- Something-v2에서 MM-ViT는 0.75×3 TFLOPs로 89.7%의 top-1 정확도를 달성하여 최신 기술 비디오 트랜스포머와 비교해도 뛰어난 효율성과 경쟁 가능한 정확도를 보였다.
  • Kinetics-600에서 MM-ViT는 4×16×224² 해상도로 83.5%의 top-1 정확도를 기록하여 Timesformer-L을 1.3% 초월하고 ViViT-L을 0.5% 초월했으며, 계산량이 더 적은데도 성능이 뛰어나다.
  • 주의 시각화 결과 모델이 관련 있는 신체 부위와 행동 관련 텍스트(예: 'Apply Eye Makeup'에서 'eye'와 'eyelid')에 효과적으로 집중하고 있음을 확인하여 시공간 추론 능력이 있음을 입증했다.
  • MM-ViT는 비디오 트랜스포머 분야에서 최신 기술 성능을 달성하였고, 광학 흐름 기반 CNN과 비교해도 성능을 극복하거나 능가함으로써 압축 도메인 내 다중모달 학습의 효과성을 입증했다.
  • 제거 실험 결과 다중모달 주의 메커니즘이 성능 향상에 크게 기여하며, 인수분해된 주의 메커니즘은 FLOPs를 감소시켜도 높은 정확도를 유지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.