Skip to main content
QUICK REVIEW

[논문 리뷰] MIST: Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering

Difei Gao, Luowei Zhou|arXiv (Cornell University)|2022. 12. 19.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

MIST는 장시간 비디오 질의응답에서 다중 이벤트 및 다중 해상도에 걸친 효율적이고 해석 가능한 추론을 가능하게 하는 다중 모odal 반복적 공간-시간 트랜스포머를 제안한다. 이는 조밀한 자기주의를 연속된, 질문 조건부의 세그먼트 및 영역 선택 모듈로 분해함으로써 실현되며, 여러 이벤트와 다양한 해상도에서 효율적으로 추론할 수 있도록 한다. MIST는 AGQA, NExT-QA, STAR, Env-QA에서 최신 기준 성능을 달성하였고, 계산 효율성과 해석 가능성 향상도 함께 확보하였다.

ABSTRACT

To build Video Question Answering (VideoQA) systems capable of assisting humans in daily activities, seeking answers from long-form videos with diverse and complex events is a must. Existing multi-modal VQA models achieve promising performance on images or short video clips, especially with the recent success of large-scale multi-modal pre-training. However, when extending these methods to long-form videos, new challenges arise. On the one hand, using a dense video sampling strategy is computationally prohibitive. On the other hand, methods relying on sparse sampling struggle in scenarios where multi-event and multi-granularity visual reasoning are required. In this work, we introduce a new model named Multi-modal Iterative Spatial-temporal Transformer (MIST) to better adapt pre-trained models for long-form VideoQA. Specifically, MIST decomposes traditional dense spatial-temporal self-attention into cascaded segment and region selection modules that adaptively select frames and image regions that are closely relevant to the question itself. Visual concepts at different granularities are then processed efficiently through an attention module. In addition, MIST iteratively conducts selection and attention over multiple layers to support reasoning over multiple events. The experimental results on four VideoQA datasets, including AGQA, NExT-QA, STAR, and Env-QA, show that MIST achieves state-of-the-art performance and is superior at computation efficiency and interpretability.

연구 동기 및 목표

  • 기존 모델들이 계산 비용과 제한된 추론 능력으로 인해 어려움을 겪는 장시간 비디오에서의 복잡한 다중 이벤트 및 다중 해상도 추론 문제를 해결하기 위해.
  • 장시간 비디오에서 조밀한 자기주의의 한계를 극복하기 위해, 질문과 관련된 세그먼트와 영역에만 집중하는 연속된 선택 기반 메커니즘을 도입하기 위해.
  • 다중 이벤트에 대한 반복적 추론을 스택된 선택 및 주의 모듈을 통해 가능하게 하여 시간적 및 인과적 추론 과제에서 성능 향상시키기 위해.
  • 짧은 비디오/이미지에서의 사전 훈련과 장시간 비디오 질의응답 간 도메인 갭을 해소하기 위해 사전 훈련된 모델을 효율적으로 적응시키기 위해.
  • 장시간 비디오 이해 벤치마크에서 성능을 유지하거나 향상시키면서도 모델의 해석 가능성과 계산 효율성을 향상시키기 위해.

제안 방법

  • 표준 조밀한 공간-시간 자기주의를 두 구성요소로 분해: 질문 컨텍스트에 기반해 동적으로 관련된 비디오 세그먼트와 이미지 영역을 선택하는 연속된 선택 모듈.
  • 질문 조건부 선택 메커니즘을 사용해, 여러 층을 거쳐 관련 시각적 요소의 집합을 반복적으로 정밀화함으로써 다중 이벤트에 대한 추론을 지원.
  • 선택된 세그먼트와 영역에 대해 다중 모달, 다중 해상도 자기주의를 적용해 다양한 해상도에서 시각적 개념 간의 복잡한 상호작용을 모델링.
  • 이중 단계 프로세스를 구현: 먼저, 미분 가능한 샘플링 전략(반복 허용 또는 비허용)을 사용해 상위-k개의 세그먼트와 영역을 선택하고, 그 다음에 학습된 주의 메커니즘을 통해 주의를 집중.
  • 비모수적 주의 변형을 도입해 분석을 위해 사용하며, 학습 가능한 파rameter 없이 사전 훈련된 시각적 및 질문 특징을 사용해 매칭 점수를 계산.
  • 반복적 정밀화를 통해 종단 간 훈련을 수행함으로써, 선택 및 주의 모듈이 질문 관련성과 추론 정확도를 함께 최적화할 수 있도록 함.
Figure 1 : Main challenges of long-form VideoQA. The questions for long-form VideoQA usually involve multi-event, multi-grained, and causality reasoning.
Figure 1 : Main challenges of long-form VideoQA. The questions for long-form VideoQA usually involve multi-event, multi-grained, and causality reasoning.

실험 결과

연구 질문

  • RQ1조밀한 자기주의와 비교해, 연속된 선택 기반 메커니즘이 장시간 비디오 질의응답에서 추론 효율성과 정확도를 향상시키는가?
  • RQ2반복적인 다중 층 선택은 장시간 비디오에서 다중 이벤트 및 복잡한 시각적 상호작용에 대한 추론을 어떻게 향상시키는가?
  • RQ3선택적 주의를 통해 사전 훈련된 시각적 및 언어 모델을 장시간 비디오 질의응답에 효과적으로 적응시킬 수 있는 정도는 어느 정도인가?
  • RQ4제안된 방법은 다중 해상도 및 다중 이벤트 추론을 포괄하는 장시간 비디오에서 희박한 샘플링 기반 모델보다 성능이 뛰어나게 되는가?
  • RQ5특히 관련 비디오 세그먼트와 영역를 국소화하는 데 있어, 표준 주의 메커니즘과 비교해 모델의 해석 가능성은 어떻게 되는가?

주요 결과

  • MIST는 AGQA, NExT-QA, STAR, Env-QA의 네 가지 장시간 비디오 질의응답 벤치마크에서 최신 기준 성능을 달성하였으며, 이는 이전 방법들보다 뚜렷한 향상이다.
  • AGQA v1에서 MIST는 전체 정확도 58.26%를 기록하였으며, 이는 동일한 시각적 특징을 사용함에도 불구하고 이전 최신 기준인 Temp[ATP]보다 4.09% 높은 성능이다.
  • 선택 모듈에서 반복 허용 방식을 사용한 변형이 반복 비허용 버전보다 성능이 뛰어나, 관련 세그먼트를 재선택함으로써 추론의 안정성이 향상됨을 시사한다.
  • 비모수적 주의 기반 베이스라인은 한 층의 MIST(반복 허용)와 유사한 성능을 보였지만, 두 개의 반복 층을 가진 MIST는 그에 비해 뚜렷이 뛰어난 성능을 보이며, 학습 가능한 반복 정밀화의 유용성을 입증한다.
  • 정성적 분석 결과, MIST는 질문 컨텍스트에 기반해 관련 비디오 세그먼트와 영역를 정확히 국소화할 수 있었지만, 부분적으로 보이는 물체나 매우 유사한 이벤트에 대해서는 어려움을 겪었다.
  • 절단 분석 결과, 반복적인 선택 및 주의 메커니즘이 특히 인과성 및 복합 질문 유형에서 복잡한 다중 이벤트 추론을 포착하는 데 핵심적인 역할을 함을 확인하였다.
Figure 2 : Diagrammatic illustration of \textcinzel MIST . It revises a standard spatial-temporal self-attention layer into two modules: a cascade selection module that dynamically eliminates question-irrelevant image regions, and a self-attention layer reasoning over multi-modal multi-grained visua
Figure 2 : Diagrammatic illustration of \textcinzel MIST . It revises a standard spatial-temporal self-attention layer into two modules: a cascade selection module that dynamically eliminates question-irrelevant image regions, and a self-attention layer reasoning over multi-modal multi-grained visua

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.