Skip to main content
QUICK REVIEW

[논문 리뷰] Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition

Hao Fei, Shengqiong Wu|arXiv (Cornell University)|2024. 05. 07.
Aesthetic Perception and AnalysisNeuroscience인용 수 3
한 줄 요약

이 논문은 복잡한 비디오 작업을 단계별로 인지적·인지적 하위 문제로 분해함으로써 인간 수준의 비디오 이해를 가능하게 하는 새로운 추론 프레임워크인 Video-of-Thought (VoT)를 소개한다. 미세한 시공간 시나리오 그래프(STSG) 기반의 비디오 다중모odal 대규모 언어 모델(MLLM)인 MotionEpic에 기반하여, VoT는 체인-오브-스스로 방식으로 픽셀 수준의 인식, 궤적 추적, 일반 지식 추론를 통합함으로써 복잡한 비디오 질의응답 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Existing research of video understanding still struggles to achieve in-depth comprehension and reasoning in complex videos, primarily due to the under-exploration of two key bottlenecks: fine-grained spatial-temporal perceptive understanding and cognitive-level video scene comprehension. This paper bridges the gap by presenting a novel solution. We first introduce a novel video Multimodal Large Language Model (MLLM), MotionEpic, which achieves fine-grained pixel-level spatial-temporal video grounding by integrating video spatial-temporal scene graph (STSG) representation. Building upon MotionEpic, we then develop a Video-of-Thought (VoT) reasoning framework. VoT inherits the Chain-of-Thought (CoT) core, breaking down a complex task into simpler and manageable sub-problems, and addressing them step-by-step from a low-level pixel perception to high-level cognitive interpretation. Extensive experiments across various complex video QA benchmarks demonstrate that our overall framework strikingly boosts existing state-of-the-art. To our knowledge, this is the first attempt at successfully implementing the CoT technique for achieving human-level video reasoning, where we show great potential in extending it to a wider range of video understanding scenarios. Project is open at https://haofei.vip/VoT

연구 동기 및 목표

  • 복잡한 비디오에서 미세한 시공간 인식과 고도의 인지적 의미를 요구하는 깊이 있는 비디오 이해의 격차를 해소하기 위해.
  • 기존의 비디오 MLLM가 얕은 인지적 이해에 집중하고 구조화된 추론 능력이 부족한 점을 극복하기 위해.
  • 체인-오브-스스로(Chain-of-Thought, CoT) 프롬프팅을 비디오 입력에 적응시켜 픽셀 수준의 기반에서 고도의 인지적 해석으로 이르는 다단계 추론을 가능하게 하기 위해.
  • 비디오 컨텐츠를 STSG 표현으로 정렬할 수 있고, STSG 기반 및 STSG 비기반 추론을 모두 지원할 수 있는 비디오 MLLM인 MotionEpic을 개발하기 위해.
  • 구조화된 단계별 추론이 복잡한 비디오 질의응답에서 정확성과 강인성을 크게 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 미세한 픽셀 수준의 기반을 위해 비디오 프레임과 시공간 시나리오 그래프(STSG)를 동시에 인코딩하는 비디오 MLLM인 MotionEpic을 제안한다.
  • STSG 애너테이션을 사용하여 비디오 입력을 구조화된 시나리오 표현과 정렬하는 기반 정렬 테이닝 단계를 도입한다.
  • 이중 단계 학습 전략을 활용한다: 첫 번째로, 지도 학습을 통해 비디오를 STSG에 기반 정렬한다; 두 번째로, STSG 입력 없이도 자율적인 STSG 파싱과 추론을 위한 파인튜닝을 수행한다.
  • 비디오 QA를 순차적 단계로 분해하는 CoT 스타일의 추론 엔진으로서 Video-of-Thought (VoT) 프레임워크를 설계한다: 대상 기반 정렬, 궤적 추적, 상호작용 분석, 답변 순위 매기기.
  • 사실 기반 일반 지식을 활용하여 행동과 상호작용을 해석함으로써 인지적으로 일관되고 설명 가능한 추론을 보장한다.
  • STSG 기반 정렬과 생성을 명시적으로 최적화하기 위해 손실 성분 𝒫₂와 𝒫₄를 사용한다. 이는 후속 추론 성능에 매우 중요한 요소이다.
Figure 1: Human-like video reasoning intuitively follows a multi-step procedure, from lower-level perceptive fine-grained pixel grounding and tracking, to higher-level cognitive action scene semantics understanding.
Figure 1: Human-like video reasoning intuitively follows a multi-step procedure, from lower-level perceptive fine-grained pixel grounding and tracking, to higher-level cognitive action scene semantics understanding.

실험 결과

연구 질문

  • RQ1미세한 STSG 기반 정렬을 갖춘 비디오 MLLM가 복잡한 비디오 이해에서 인지 정확도를 크게 향상시킬 수 있는가?
  • RQ2다중모달 입력에 적응시킨 체인-오브-스스로(CoT) 파рад림이 비디오 추론에 얼마나 효과적인가?
  • RQ3일반 지식 통합이 시각적 인식을 초월하여 비디오 컨텐츠에 대한 추론 능력을 얼마나 향상시키는가?
  • RQ4구조화된 시나리오 표현(STSG)이 환영 현상 감소와 추론 강인성 향상에 어떤 역할을 하는가?
  • RQ5통합 프레임워크가 STSG 기반 및 STSG 비기반 추론을 모두 지원하면서도 높은 성능을 유지할 수 있는가?

주요 결과

  • VoT 프레임워크를 갖춘 MotionEpic는 기존의 Video-LLaVA와 CoT를 사용한 모델들을 능가하는 복잡한 비디오 질의응답 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 제거 실험 결과, STSG 기반 정렬 및 생성과 관련된 손실 성분 𝒫₂와 𝒫₄를 제거할 경우 성능 저하가 가장 크게 발생함을 확인하여 이들의 핵심적 역할을 입증한다.
  • 200개의 어려운 예제에 대한 인간 평가 결과, VoT를 갖춘 MotionEpic는 특히 행동 의미와 일반 지식 이해 측면에서 인간 수준의 추론 능력과 유사한 성능을 보였다.
  • 정성적 사례 연구를 통해 VoT는 정확한 기반 정렬과 사실 기반 추론을 결합하여 복잡한 장면(예: 트레이너가 개를 훈련시키는 장면)을 정확히 식별하는 데 성공했으며, 기준 모델들은 실패함을 확인했다.
  • VoT 프레임워크는 특히 원인-결과 역학과 사회적 상호작용에 대한 추론에서 기존의 CoT 기반 방법에 비해 오류율을 크게 감소시켰다.
  • 구조화된 단계별 추론 과정 덕분에 시스템은 새로운 비디오 추론 작업에 대해 조건 없이도 강력한 zero-shot 일반화 능력을 유지한다.
Figure 2: Overview of the MotionEpic video MLLM.
Figure 2: Overview of the MotionEpic video MLLM.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.